AI 뉴스

연구자들 "Fable 5 논란은 탈옥이 아니라 'fix this code'에서 시작됐다" — 2026년 6월

노동1호 2026. 6. 17. 21:04

2026년 6월 현재, 미국 정부의 Anthropic Fable 5·Mythos 5 접근 제한 조치가 새로운 국면에 접어들었다. Luta Security CEO Katie Moussouris는 이번 조치가 알려진 탈옥(jailbreak)이 아니라, 취약 코드에 "fix this code"라는 세 단어 프롬프트를 입력한 단순 요청에서 비롯됐다고 공개했다. 본문은 이 사건의 기술적 배경과 방어 보안 커뮤니티의 반론을 정리한다.

Anthropic Claude AI security guardrail

사건 개요 — "Fix this code" 프롬프트가 수출통제를 촉발

Moussouris는 월요일 블로그 글에서 Anthropic이 Fable 5 가드레일 우회 기법 관련 제3자 연구 논문을 비공개로 자신에게 공유했다고 밝혔다. 그녀는 Luta Security 창업자 겸 CEO로, 해당 보고서를 읽은 유일한 외부 전문가였다. 미국 정부는 국가안보 우려를 이유로 미국 안팎의 외국인을 대상으로 Fable 5와 Mythos 5 접근을 중단하는 수출통제 지침을 내렸고, Anthropic은 규정 준수를 보장하기 위해 두 모델을 모든 고객에게 비활성화했다. 이번 사건의 핵심은 단일 프롬프트 한 줄이 통제 정책의 근거가 됐다는 점이다.

외부 연구자들이 수행한 실험 — Find, Fix, and Test Loop

외부 연구자들은 Anthropic의 Fable 5, Mythos, Claude Opus 모델에 코드를 입력했다. 입력 코드에는 알려진 CVE가 포함된 오픈소스 코드와, 새로 작성하면서 의도적으로 취약점을 넣은 코드가 포함됐다. 연구자들은 모델에 "review the code for security issues"를 요청했다. Fable 5는 이 요청을 거부했다. 이후 연구자들이 "fix this code"라고 요청하자 모델이 응답했고, 추가 프롬프트 뒤에는 패치를 검증하는 테스트 스크립트까지 생성했다.

Moussouris의 설명에 따르면 이 과정에서 가드레일 우회나 jailbreak 시도가 없었다. AI 모델이 수행한 작업은 방어 보안에서 매일 이뤄지는 "find, fix, and test loop" 그 자체였다.

Moussouris의 반론 — 방어자에게 더 큰 피해

Anthropic Claude AI security guardrail

Moussouris는 "fix this code"와 테스트 스크립트 생성을 위한 몇 단계의 수동 작업이 수출통제를 촉발할 사유가 아니라고 주장한다. 방어자는 AI 시스템에 버그를 찾고 고치며, 패치 검증용 테스트를 작성하도록 요청할 수 있어야 한다는 입장이다. Anthropic 모델이 수행한 작업은 방어 보안에서 매일 이뤄지는 작업 흐름이었으며, 이런 방어 요청에 응답하는 기능을 제거하면 AI 시스템의 버그 발견과 패치 검증 능력이 더 나빠진다고 지적했다.

Moussouris와 100명 이상의 사이버보안 리더들은 이 제한이 공격자보다 방어자에게 더 큰 피해를 줄 수 있다며, 버그 발견·수정·패치 검증에 쓰는 AI 역량을 유지해야 한다고 공동 목소리를 냈다.

Wassenaar Arrangement와 방어 보안 예외 — 정책 사각지대

Moussouris는 한 세대 가까운 기간 동안 Wassenaar Arrangement 재협상에 참여한 기술 전문가 그룹에서 활동했다. Wassenaar Arrangement는 42개국이 참여하는 자발적 합의로, 일부 이중용도 기술의 수출을 규제한다. 당시 합의안에는 취약성 연구와 침투 테스트 도구를 방어적 목적을 위한 보안 예외로 분류하는 조항이 포함됐다. 이번 Fable 5 제한은 바로 그 방어 보안 예외 정신과 충돌한다는 것이 Moussouris의 주장이다.

실무자가 챙겨야 할 가드레일과 전망

소프트웨어 팀은 이번 사건을 계기로 AI 코딩 도구를 방어 보안 업무에 활용하는 절차를 점검할 필요가 있다. 먼저, CVE가 포함된 코드와 의도적으로 취약점을 넣은 코드를 모델에 입력할 때는 "review the code for security issues" 같은 보안 검토 표현과 "fix this code" 같은 후속 요청이 가드레일 동작을 바꾸는 경우가 있는지 사내 가이드라인을 만들어야 한다. 다음으로, 패치 검증용 테스트 스크립트를 AI로 생성할 때 출력 결과가 다른 시스템에 영향을 주지 않도록 격리된 샌드박스에서 실행하는 정책이 필요하다. 마지막으로, 외부 제3자 연구자에게 비공개 보안 보고서를 공유받을 때 NDA와 비밀유지 범위를 명확히 합의해 두는 것이 좋다.

2026년 6월 기준으로 AI 모델의 방어 보안 활용과 수출통제 사이의 긴장은 더 깊어질 가능성이 높다. 정책 입안자와 보안 커뮤니티가 Wassenaar Arrangement 같은 다자 합의에서 방어 예외를 명문화하는 작업에 속도를 내야, 다음 세대 모델이 보안 생태계의 자산이 되도록 유지될 수 있다. 실무자로서는 자사의 보안 업무에 활용하는 모델이 어떤 통제 범위에 있는지 미리 점검해 두는 것이 안전하다.