AI 뉴스

Claude Fable 5와 Mythos 5, Anthropic의 5세대 프런티어 모델이 등장하다

노동1호 2026. 6. 10. 20:03
Claude Fable 5 cover
Claude Fable 5 / Mythos 5 — Anthropic의 5세대 프런티어 모델

Claude Fable 5와 Mythos 5, Anthropic의 5세대 프런티어 모델이 등장하다

Anthropic이 며칠 단위 장기 작업을 위한 5세대 모델을 공개했다. Fable 5는 일반 사용자용 안전 버전이고, Mythos 5는 같은 모델에서 일부 안전장치를 풀어 연구·기업용으로 내보낸 버전이다. Opus급 위에 새로 만든 Mythos급이라는 등급이 공식 등장한 것도 이번이 처음이다. 이름은 라틴어 fabula(이야기되는 것)와 그리스어 mythos에서 따왔다. 두 모델의 본체는 같고, 다른 건 안전장치 작동 범위뿐이다. 작업이 길고 복잡할수록 우위가 커진다는 게 핵심 메시지다.

Fable 5와 Mythos 5의 차이 — 같은 몸, 다른 안전장치

Fable 5는 Mythos급을 일반 사용자가 쓸 수 있도록 안전장치만 조정한 버전이다. Mythos 5는 동일 모델에서 사이버보안·생물학·화학·디스틸레이션 영역의 안전장치를 일부 해제해, 검증된 연구자와 기업이 더 깊은 작업에 활용할 수 있게 했다. 가격은 입력 100만 토큰당 10달러, 출력 50달러로 Mythos Preview의 절반 이하다. API 모델명은 claude-fable-5다. Enterprise(소비량 기반) 플랜과 Claude Platform, AWS, GCP, Microsoft Foundry에서 오늘부터 완전 이용 가능하다. Mythos 5는 기존 Mythos Preview 사용자(Glasswing 파트너 등)가 업그레이드할 수 있고, 대부분 경우 Preview와 비슷하거나 약간 더 강하면서 비용은 크게 저렴해졌다.

코딩과 에이전트 능력 — Stripe 5천만 라인을 하루 만에

Fable 5는 Stripe 사전 테스트에서 5천만 라인 Ruby 코드베이스의 전체 마이그레이션을 하루 만에 수행했다. 같은 작업을 사람이 하면 두 달 이상 걸린다고 한다. 모델은 직접 테스트를 작성하고, 비전으로 결과물을 원본 디자인과 대조 검증까지 했다. Cognition의 FrontierCode 평가에서 medium effort만으로 프런티어 모델 중 최고점을 받았다. Claude Code 환경에서는 수일간 자율 작동하며 계획 수립, 서브에이전트 위임, 자기 검증까지 수행한다. Hacker News 사용자 한 명은 "몇 달째 미뤄둔 아주 어려운 문제들을 던졌는데 꽤 잘 처리했다"고 평가했다. 또 다른 사용자는 Claude Code 4.8이나 ChatGPT Codex 5.5가 풀지 못했던 리버스 엔지니어링 문제를 30분 만에 해결했다고 보고했다. PR 변경 줄 수가 줄고, 유지보수하기 좋은 코드를 작성한다는 후기도 눈에 띈다.

지식작업과 비전, 메모리 — 문서 분석과 게임 클리어

Hebbia 금융 벤치마크에서 전 모델 중 최고점을 찍었고, IMC 트레이딩 분석 평가는 거의 전 영역을 통과했다. 스크린샷만으로 웹앱 소스코드를 재구성한다. 비전 전용 최소 하니스로 포켓몬 파이어레드까지 클리어해, 이전 모델들이 필요로 한 복잡한 보조 하니리를 대체했다. Slay the Spire에서는 파일 기반 지속 메모리를 제공했을 때 Opus 4.8 대비 성능이 3배, 최종장 도달 빈도도 3배 뛰었다. 50쪽짜리 촘촘하고 서로 연결된 명세 PDF를 주면, 완료·부분 완료·빠진 부분을 정확히 표시하고 코드가 명세에서 어디를 벗어났는지도 상세히 설명한다. UI 디자인의 시각적 측면을 다루는 능력도 크게 향상됐다. 토큰 효율이 절반가량 좋아져 가격상으로도 Opus 4.8과 거의 비슷해졌다는 평가가 있다.

벤치마크 수치 — SWE-Bench Pro 80.3%

SWE-Bench Pro 80.3%, GDPval-AA 1932, OSWorld 85.0% 등 코딩·지식·비전·컴퓨터 유즈 전반에서 우위를 기록했다. Opus 4.8은 69.2%, GPT 5.5는 58.6%였다. 다만 표의 일부 수치는 Mythos 5와 Fable 5 중 높은 값이고, 별표 항목은 안전장치 fallback으로 Opus 4.8에 가까운 성능이라는 주석이 붙어 있다. FrontierCode 벤치마크의 Fable 5 xhigh는 29.3%로, Opus 4.7 xhigh 5.2%, Opus 4.8 xhigh 13.4%에서 큰 도약을 보였다. METR 보고서를 인용한 시스템 카드에는 Mythos 5가 38개의 가장 어려운 소프트웨어 작업에서 이전 공개 모델들이 풀지 못한 과제 일부를 성공했다고 적혀 있다. 다만 여러 주에 걸친 최전선 프로젝트의 연구개발을 완전하고 안정적으로 자동화할 가능성은 낮다고 회사 측도 인정한다.

안전장치, 30일 데이터 보존, 그리고 가격

안전장치 분류기가 막는 영역은 사이버보안, 생물학·화학, 디스틸레이션 세 가지다. 해당 요청은 자동으로 Opus 4.8로 우회되고, 우회 시 Fable 요금은 청구되지 않는다. 세션의 95% 이상은 fallback 없이 진행된다. 외부 버그바운티 1,000시간 이상에서 유니버설 탈옥은 발견되지 않았고, 30종 공개 탈옥 기법을 써도 유해 단일턴 요청에 0건 응답했다고 파트너 테스트에서 확인됐다. 사용 시 안전 모니터링을 위해 30일 데이터 보존이 필수다. 1st party와 3rd party 모든 트래픽에 적용되고, 학습이나 비안전 목적엔 사용하지 않으며 30일 후 삭제된다. 가격은 구독 플랜에서 6월 9일부터 6월 22일까지 무료 포함 후 6월 23일부터는 usage credit이 필요하다. 다만 분류기가 민감해서 무해한 요청도 Opus 4.8로 fallback되는 경우가 있다는 후기다.

그래서 우리도 따라 할 수 있는가

Fable 5와 Mythos 5는 단순한 점수 경쟁이 아니라, 며칠 단위 자율 작업을 상용 API로 끌어내린 첫 사례다. 실전에서 검증해볼 만한 지점은 세 가지다. 첫째, 장기 자율 코딩 작업에서 기존 Opus 4.8과 비교해 토큰 효율이 정말 절반에 가까운지. 둘째, 분류기의 false positive가 일반 코딩 작업에서 얼마나 자주 걸리는지. 셋째, 30일 데이터 보존 정책이 팀의 컴플라이언스 요건과 충돌하지 않는지. 직접 30분이라도 돌려봐야 체감할 수 있는 영역이다. 지금은 Cursor와 Claude Code에서 사용 가능하고, API·Enterprise는 오늘부터 완전 이용 가능하다. 여유가 되면 6월 22일 무렵까지는 무료 포함 기간이니 부담 없이 시험해볼 수 있다. 다만 Mythos 5의 다섯 가지 영역 안전장치가 풀린 만큼, 어떤 용도로 쓸지 팀 차원에서 미리 합의해두는 편이 안전하다.