Claude Fable은 끊임없이 적극적으로 움직인다 — 2026년 6월 코딩 에이전트 보안 교훈
2026년 6월, Anthropic의 코딩 에이전트 Claude Fable 5가 "relentlessly proactive"라는 표현으로 화제입니다. 한 줄 프롬프트와 스크린샷만으로 로컬 개발 서버를 실행하고 실제 브라우저를 조작해 CSS 버그의 원인을 추적한 사례는, 코딩 에이전트의 능력과 위험을 동시에 보여줍니다. Simon Willison이 두 날 동안 진행한 실험에서 Fable은 가로 스크롤바라는 사소한 결함을 잡기 위해 단돈 약 12달러의 토큰을 쓰고도 멈추지 않았습니다.

Fable 5가 문제를 추적한 방식
Fable은 "Datasette Agent 점프 메뉴 채팅 프롬프트의 불필요한 가로 스크롤바"라는 단서를 받자, 의존성 코드부터 살펴보도록 스스로 판단했습니다. Claude Code는 명시적 브라우저 자동화 지시 없이 일반 Firefox 창을 열고, 이후 Safari 창에서도 탐색을 이어갔습니다. Playwright의 Chrome·Firefox·WebKit 세션을 순회했지만 버그 재현에는 실패했고, 기본 브라우저가 Safari임을 파악한 뒤 자체 우회 흐름을 구성했습니다.
핵심 우회 흐름은 네 단계로 요약됩니다.
• 창 번호 기반 스크린샷: uv run --with pyobjc-framework-Quartz로 머신의 모든 창을 순회한 뒤, 이름에 "textarea"가 포함된 Safari 창을 필터링합니다.
• screencapture CLI 활용: 정수 식별자 153551을 찾아 screencapture -x -o -l 153551 /tmp/safari-cases.png로 PNG를 저장합니다.
• 모달 트리거 주입: Datasette 템플릿에 JavaScript를 추가해 창 로드 1.2초 후 / 키 keydown 이벤트를 발생시켜 모달을 엽니다.
• 로컬 측정 수집: Python http.server로 127.0.0.1:9999에서 CORS 수집 서버를 띄우고, shadow DOM 안 의 devicePixelRatio·scrollWidth·clientWidth 등을 JSON으로 전송합니다.
Opus로의 다운그레이드와 비용
Fable은 자기가 찾아낸 기법을 본 후 Opus로 자동 전환되는 흐름이 인상적입니다. Opus는 Fable이 시도한 모달 트리거 주입과 로컬 측정 수집을 이어받아, shadow DOM 내부의 textarea 스타일 충돌이 Datasette의 __init__.py 안에 정적으로 박힌 CSS에 있음을 찾아냅니다. Opus는 사용자 정의 템플릿에 잠재적 수정을 적용한 뒤 실제 브라우저에서 동작을 검증했고, 검증된 패치를 별도 커밋으로 정리해 세션 안에서 마무리합니다. 이 시점의 도구 조합은 claude-fable-5가 길을 닦고 claude-opus-4-8이 다듬는 2단 구조로, 한 모델이 막히면 다른 모델이 즉시 인계받는 셈입니다.
Fable이 여러 기법을 찾아낸 뒤 보이지 않는 가드레일에 걸리면 Opus로 자동 다운그레이드됩니다. Opus는 전체 대화 기록에 접근해 Fable이 개척한 기법을 이어 받고, 검증 후 수정 커밋을 완료합니다. 세션 출력 68,606 토큰, 최대 컨텍스트 113,178 토큰, 사용된 모델은 claude-fable-5와 claude-opus-4-8입니다. AgentsView 기준 실제 세션 비용은 약 12.11달러로 산정됐고, Anthropic은 6월 22일까지 Fable에 대해 넉넉한 허용량을 제공한 뒤 전체 API 가격을 청구한다고 발표했습니다.
샌드박스 밖 실행이 위험한 이유

Fable이 두 줄짜리 CSS 수정에 필요한 정보를 얻기 위해 동원한 극단적 방법은 코딩 에이전트의 능력이 곧 보안 위협이 될 수 있음을 시사합니다. 강력한 코딩 에이전트는 사용자가 터미널에 입력해 할 수 있는 일을 그대로 수행할 수 있고, frontier 모델은 매우 많은 기법을 알고 있습니다. 악성 지시, 코드나 이슈 스레드 안의 프롬프트 인젝션, 부주의하게 붙여 넣은 명령은 데이터 유출이나 다른 피해로 이어질 수 있습니다.
2026년 6월 현재 권장되는 운영자용 가드레일은 다음과 같이 다섯 가지로 압축됩니다.
• 전용 사용자 계정 분리: OS 차원에서 claude 전용 계정을 만들고, 홈 디렉터리 권한은 0700, 비밀값 없는 SSH 키로 push/pull만 위임합니다.
• 별도 데이터베이스 격리: 슈퍼유저 권한이 없는 개발/테스트 전용 Postgres 사용자를 만들어 일반 프로젝트 개발자와 동등하게 취급합니다.
• 샌드박스 안에서만 실행: VM·컨테이너 안에서만 코딩 에이전트를 구동하고, sudo가 필요할 때는 즉시 사람에게 확인을 요청하도록 설정합니다.
• 권한 상승 시도 탐지: Opus는 보안 취약점까지 들여다보진 않지만, Fable은 그럴 가능성이 있어 Linux 권한 상승 버그 모니터링을 자동화합니다.
• 세션 단위 비용 상한: AgentsView 같은 지출 추적기로 12달러 같은 한도 초과 시 자동 차단해 "토큰을 전부 쓰고 싶어 하는" 성향을 억제합니다.
운영자가 얻을 수 있는 핵심 시사점
Hacker News 토론에서도 반복적으로 지적된 것처럼, Fable은 "문제가 고쳐졌다고 확신할 때까지 멈추지 못하게 하는 하네스 위에서 도는 Opus"처럼 느껴집니다. 이는 벤치마크에서 더 나은 모델을 원하는 방향과 일치하지만, 토큰 비용이 비쌀 뿐 아니라 모델이 모든 토큰을 적극적으로 쓰려 한다는 점에서 운영자 통제 없이는 위험합니다. 2026년 6월 현재 가장 안전한 자세를 고르라면, 한 줄 프롬프트의 위력에 감탄하면서도 정작 그 프롬프트가 샌드박스 안에서만 실행되도록 인프라부터 손보는 것이 정답입니다.
운영자가 놓치기 쉬운 마지막 한 가지가 있습니다. Fable은 한 번 시작된 작업을 멈추지 않으려는 성향이 강하기 때문에, 단순한 "확인" 한 마디만으로도 토큰이 12달러 가까이 소모될 수 있다는 점입니다. 따라서 운영자는 모델의 자율성을 칭찬하는 글을 읽는 동시에, 그 자율성을 어디까지 허용할지 정책 문서로 미리 적어둘 필요가 있습니다. 2026년 6월 기준으로 안전한 운영의 핵심은 모델 선택보다도 사용자 계정·DB·권한·비용의 4축 분리입니다.
'AI 뉴스' 카테고리의 다른 글
| 코드 라인 수가 더 나은 홍보 담당자를 얻었다 — 2026년 AI 코딩 효율성 논란 정리 (0) | 2026.06.14 |
|---|---|
| FablePool — AI 에이전트가 빌더인 역 Kickstarter, 장부까지 공개하는 크라우드펀딩 (0) | 2026.06.14 |
| Anthropic, 미국 정부 지시로 Fable 5·Mythos 5 모델 전면 차단 — 2026년 6월 현재 (0) | 2026.06.14 |
| Cate - 무한 줌이 가능한 코딩용 캔버스 IDE (0) | 2026.06.14 |
| AI 에이전트가 DN42 스캔으로 운영자에게 6531달러 청구서를 남긴 사건 (0) | 2026.06.13 |