앤트로픽, 클로드 페이블 5.1·미토스 5.1 신모델 공개
앤트로픽이 코딩·지식 노동·장기 문제 해결을 겨냥한 클로드 페이블 5.1과 클로드 미토스 5.1을 공개했다. 회사 설명대로면 둘은 같은 모델이고 가드, 곧 안전장치의 수준만 다르다. 페이블 5.1은 일반에 열리고, 미토스 5.1은 신뢰 접근 프로그램으로만 들어간다. 발표의 실무적 핵심은 점수 자체보다, 고객이 불만을 밝혀 온 가격·데이터 보관·가드를 어떻게 나눠 고쳤는지에 있다.
같은 모델에 출입문만 둘
앤트로픽은 두 모델을 코딩과 지식 작업에서 가장 앞선 모델로 소개하고, 연구 능력은 인공지능이 과학 진전에 기여하는 방식의 초기 모습이라고 적었다. 미토스 5.1의 가드는 사이버보안과 생명과학 작업을 뒷받침하도록 짜여 있다. 더 버지 보도에 따르면 페이블 5.1은 모든 플랫폼에서 쓸 수 있고, 미토스 5.1은 프로젝트 글래스윙 참여자에게만 제공되며 이 프로그램과 함께 나온다.
성능 주장의 뼈대는 전작 페이블 5보다 수행력이 높다는 점, 그리고 노력 수준을 낮음이나 중간으로 두면 페이블 5와 비슷하거나 더 나은 결과를 훨씬 낮은 비용에 낸다는 점이다. 기본값은 제품마다 다르다. 클로드 코드는 높음, 클로드 코워크와 claude.ai는 중간이다. 같은 모델을 어디에 붙이느냐에 따라 깊이와 요금이 먼저 갈린다.
가격·보관·오탐, 고객이 묻던 세 축
회사는 능력이 오른 만큼 가격, 데이터 보관, 가드에 대한 피드백을 반영했다고 밝혔다. 토큰으로 과금되는 일반적인 작업에서 페이블 5.1은 페이블 5보다 약 25% 쌀 것으로 추정한다. 이유는 새 계산이 아니라, 이미 처리해 저장한 입력을 다시 읽는 캐시 읽기 단가를 낮춘 데 있다. 캐시를 반복해서 읽는 에이전트형 작업은 절감이 더 커져 대략 최대 45%까지 줄어들 수 있다고 했다. 긴 작업을 맡길수록 체감 요금이 가파르게 내려가는 구조다.
보관의 새 장치는 엔터프라이즈 프론티어 세이프가드, EFS다. 적대적 사용을 막는 수준은 유지한 채, 제로 데이터 보관과 같은 완전한 프라이버시를 준다는 설명이다. 데이터를 앤트로픽 쪽이 아니라 고객이 통제하는 클라우드에 둔다. 기업 고객에게는 올가을 후반부터 단계적으로 열린다. 그때까지는 자격이 되는 고객이 페이블 5.1을 제로 데이터 보관으로 쓸 수 있다. 민감한 업무를 클라우드 약정과 맞춰야 하는 조직에는, 모델 성능보다 이 일정표가 먼저 보이는 대목이다.
가드는 무해한 내용을 위험으로 표시하는 오탐을 줄이는 쪽으로 좁혔다. 사이버보안에서 새 가드는 이전보다 오탐을 60% 덜 막는다. 페이블 5.1은 소프트웨어 취약점을 찾는 데 쓸 수 있지만, 그 취약점으로 익스플로잇을 만드는 데는 막혀 있다. 더 버지는 침투 테스트, 익스플로잇 생성, 바이너리 기반 취약점 스캔 같은 작업은 여전히 오퍼스 모델로 넘긴다고 전했다. 생물학에서는 미국 정부와 함께 만든 접근 프로그램으로 미토스 5.1의 고급 능력을 열고, 과학자 등록은 곧 시작할 것으로 회사는 기대한다고 적었다. 더 버지에 따르면 페이블 5.1의 가드는 페이블 5보다 기초 생물학 질문을 덜 막고, 미토스 5.1의 생물학 제한은 이전 모델과 같다. 일반 제품의 오탐을 줄이는 일과, 고급 생물학을 별도 출입구로 두는 일이 동시에 진행되는 셈이다.
개발자·기업·연구실에서 달라지는 일
초기 이용 조직의 평은 ‘오래 돌려도 맥락을 붙잡는지’로 모인다. 투자회사 밀레니엄 테스트에서 페이블 5.1은 내부 시스템의 드문 충돌 원인을 찾았고, 엔지니어와 다른 어떤 모델도 몇 해 동안 설명하지 못한 문제였다고 회사는 전했다. 한 초기 사용자는 약 100만 번에 한 번 나는 충돌을 4~5년간 설명하지 못했고 페이블 5를 포함한 이전 모델도 놓쳤으나, 페이블 5.1이 외부 벤더 라이브러리를 분해해 코어 덤프와 맞춘 뒤 그 라이브러리 버그로 좁혔다고 했다.
요금을 바로 다시 계산하는 쪽도 있다. 한 팀은 출시일에 데빈의 오퍼스 5 트래픽을 페이블 5.1로 옮긴다고 했고, 테스트에서는 작업당 비용이 더 낮은 채로 페이블 5와 비슷하거나 앞섰다고 했다. 캐시가 싸지면서 코드 리뷰처럼 오퍼스에 남겨 두던 일에도 페이블급을 쓰기 시작했다는 뜻이다. 다른 팀은 자기 시험에서 오퍼스 5보다 약 두 배 빠르고 토큰은 약 절반이었다고 했고, 페이블급 지능에 오퍼스급 가격, 소넷급 속도라고 불렀다. 에브리의 댄 시퍼 최고경영자는 더 버지 보도에서, 써 본 코딩 모델 중 가장 강하면서도 빠르고 토큰을 아끼며 보통 사람처럼 말한다고 평가했다. 더 버지는 박스의 에런 레비 최고경영자가, 같은 시험에서 페이블 5가 놓친 데이터의 미묘한 차이와 모호함을 자사 에이전트가 집어냈다고 말했다고 전했다.
길게 맡겨 두는 작업의 사례도 구체적이다. 한 팀은 기계학습 문제를 약 38시간 방치 운행했더니, 모델이 이전 결과를 라벨 오류로 진단하고 고친 뒤 실험 여섯 개를 밤새 병렬로 돌리고 다음 단계까지 들고 왔다고 했다. 열린 지시만 줬을 때는 주인이 없던 경보가 실제 장애와 연결돼 있음을 찾아 로그를 당기고 수정을 적었다. 가장 어려운 브라우저 에이전트 벤치마크에서는 과제를 약 10분씩에 82% 끝냈고, 오퍼스 5는 74%, 페이블 5는 57%였다. 토큰은 둘보다 적었고, 수백 건을 재는 동안 정해 둔 중단 지점을 넘기지 않았다고 한다. 사고 조사 평가에서는 실제 장애를 두고 엔지니어가 찾은 원인과 비교하는데, 오퍼스 5보다 추론이 강했고 시험한 것 중 가장 복잡한 장애를 진단했다고 파트너는 적었다.
문서와 금융 업무를 보는 팀에도 숫자가 있다. 계약서 수정 벤치마크 레드라인벤치에서는 페이블 5의 47.9에서 57.0으로 올랐고, 증가의 상당 부분이 첫 턴 품질에서 나왔으며 그 구간은 이전 점수의 두 배 수준이었다고 했다. 수정 폭은 더 짧아졌다. 투자 업무 벤치마크 프론티어파이낸스에서는 루브릭 점수 55.9%로 페이블 5의 49.2%를 앞섰다. 실적 질문에서 2차 기사 대신 실적 발표 녹취로 가, 경영진이 말한 수치를 그대로 집었다는 사례가 붙는다. 내부 금융 벤치마크에서는 정확도는 페이블 5와 맞먹으면서 토큰은 20% 적었다. 일상 지식, 목적이 분명한 조사, 초안과 산출물에서 평가자는 페이블 5.1의 답을 페이블 5보다 대략 2대 1로 골랐다. 커서벤치 3.2에서는 최대 노력에 73.4%로, 그 팀이 돌린 모델 중 가장 높았고 자기 검증이 강점이라고 했다. 18개월째 시험대로 쓰던 난제에서는 눈에 띄는 진전이 있었고, 페이블 5가 한계에 닿았던 연산 커널을 약 35% 더 다듬었다는 후기도 있다.
과학은 사례로 제시됐다. 미토스 5.1에 오픈소스 단백질 설계·접힘 도구를 맡기고, 설계를 외부 기관 두 곳에 보내 실험으로 확인했다. 세 개 표적에서 결합 친화도는 어댑티브 바이오 대회에 제출된 최고 설계보다 10배 높았다. 12개 표적에서 실제로 붙는 설계 비율은 거의 50%로, 회사가 지금까지 잰 것 중 가장 높았다. 오늘날 단백질 설계의 그 비율은 보통 10~15%라고 회사는 비교했다. 높은 친화도의 결합체는 많은 약물에서 개발의 첫 단계라는 맥락도 달았다. 페이블 5.1은 신경망을 학습시켜 금성 표면 3분의 1의 새 고해상도 고도 지도를 만들었고, 30년이 넘은 나사 마젤란 임무의 레이더 영상을 바탕으로 했다. 라쿠텐 메디컬의 임상 연구 과제를 보게 했더니, 다른 프런티어 모델 셋이 통과시킨 빈틈을 찾아 추가 검증을 요구하고, 버려 둔 데이터셋을 새 연구 방향으로 돌리는 가설을 한 오후 만에 냈다는 후기도 있다.
숫자를 읽을 때 같이 볼 조건
표 안의 성적은 회사와 초기 파트너가 고른 측정이다. 터미널벤치-사이언스 0.1에서 회사 셋업은 공개 리더보드의 오퍼스 5 30.0%, 페이블 5 21.4%를 각각 29.0%, 24.7%로 다시 돌렸고, 둘 다 잡음 안이라고 했다. 모델당 표준오차는 ±3.5~4.5포인트다. 공개 리더보드는 과제당 3회, 클로드 코드 하네스 기준이다. 재현값과 공개값이 어긋나도 오차 안으로 본다는 전제를 회사가 먼저 밝혀 둔 셈이라, 한 자리 차이로 순위를 단정하기는 어렵다.
터미널벤치 4.0에서 페이블 5.1과 미토스 5.1의 간격은 밑바탕 모델이 달라서가 아니다. 회사는 둘을 같은 모델로 두고, 점수 차이는 예전보다 덜 정밀했던 사이버 가드가 끼어든 과제 때문이라고 설명한다. 오늘 그 가드를 고치면 차이는 훨씬 작아질 것으로 본다. 더 버지가 전한 지적도 같은 결이다. 리산 알 가이브는 벤치마크에서 미토스 5.1을 낮은 추론으로 두면, 전작을 최대 추론으로 둔 점수와 같았다고 짚었다. 노력 단계를 맞추지 않으면 모델 비교가 가드의 개입량과 섞인다.
페이블 5.1 평가는 실제 서비스 가드를 켠 채 했다. 가드가 개입한 과제에서 페이블 5.1과 페이블 5는 OSWorld 2.0에서 0점이었고, 페이블 5는 오토메이션벤치에서도 0점이었다. 그 밖의 개입에서는 사이버보안 과제를 클로드 오퍼스 4.8이, 생물학 과제를 클로드 오퍼스 5가 대신 수행했다. 회사는 이 처리가 해당 벤치마크에서 두 페이블의 성적을 낮췄을 가능성이 있다고 적었다. 막힌 과제일수록 표의 0점은 능력 부족이 아니라 가드가 일을 다른 모델에 넘긴 결과일 수 있다.
접근 조건도 발표문이 스스로 정해 둔 범위가 있다. 미토스의 고급 생물학은 과학자 등록을 곧 연다는 예정 단계이고, 모델 이용은 글래스윙을 포함한 신뢰 접근으로 묶여 있다. EFS는 올가을 후반의 단계 개방이고, 그 전에는 자격이 되는 고객만 제로 데이터 보관으로 페이블 5.1을 쓴다. 취약점 탐지는 열렸지만 익스플로잇 제작과 일부 공격적 점검은 오퍼스로 넘어간다. 비용을 페이블 5와 비교할 때는 토큰 과금이라는 전제와, 캐시를 얼마나 다시 읽는지가 25%와 45% 사이를 가른다.
정리
지금 바로 손이 가는 변화는 페이블 5.1 쪽에 있다. 캐시 읽기가 싸져, 토큰으로 내는 일반 작업은 페이블 5보다 약 25%, 긴 에이전트 작업은 최대 약 45%까지 줄어들 수 있다는 것이 회사의 추정이다. 취약점을 찾는 일은 열리고 익스플로잇을 만드는 일은 막히며, 사이버 오탐 차단은 이전보다 60% 줄었다. 클로드 코드는 노력이 높음으로 켜지니, 비용을 더 내리려면 낮음·중간을 따로 봐야 한다. 파트너 시험에서는 긴 무인 작업, 장애 원인 추적, 금융 문서의 1차 출처 확인에서 전작·오퍼스 5와 갈렸다는 사례가 반복된다.
한 박자 늦게 볼 것은 미토스와 EFS다. 고급 생물학은 미국 정부와 만든 프로그램으로 과학자 등록이 곧 열릴 예정이고, 미토스 이용은 글래스윙 등 신뢰 접근에 머문다. 데이터를 고객 클라우드에 두는 EFS는 올가을 후반부터 기업에 단계적으로 들어오며, 그 전에는 자격 있는 고객의 제로 데이터 보관이 임시 통로다. 점수표를 비교할 때는 가드가 0점을 만든 과제, 오퍼스로 넘어간 작업, 노력 수준을 같이 읽는 편이 맞다. 같은 모델을 누구의 클라우드에서, 어느 가드로, 어느 노력에 돌리느냐가 이번 발표에서 실제로 갈리는 지점이다.
출처: Anthropic — https://www.anthropic.com/claude-fable-and-mythos-5-1
교차 확인: The Verge — https://www.theverge.com/ai-artificial-intelligence/987830/anthropic-claude-fable-mythos-5-1
댓글
댓글 쓰기