AI 에이전트에게 수십 쪽짜리 업무 지침을 주면 실제 작업에서도 규칙을 지킬까요? HANDBOOK.md는 이 질문을 금융, 의료 청구, 보험, 물류, 인사 업무를 본뜬 65개 과제로 검증하는 벤치마크입니다. 단순 질의응답이 아니라 장시간에 걸쳐 여러 도구를 호출하면서 문서에 적힌 권한, 임계값, 승인 절차를 끝까지 따르는지를 측정합니다.

긴 지침을 읽는 것과 지키는 것은 다르다
오늘날 에이전트 평가는 정답률이나 코드 실행 성공 여부에 집중하는 경우가 많습니다. 하지만 실제 조직에서는 결과만 맞는 것으로 충분하지 않습니다. 승인 한도를 넘기지 않았는지, 민감 정보에 접근할 권한이 있었는지, 예외 상황에서 정해진 담당자에게 넘겼는지도 중요합니다. HANDBOOK.md는 바로 이 절차 준수 능력을 별도의 품질 축으로 다룹니다.
특히 과제마다 규칙을 바꾼 점이 핵심입니다. 모델이 금융이나 보험 분야에서 익힌 익숙한 관행을 재사용하는 대신, 그 순간 제공된 문서를 직접 찾아 근거로 삼아야 합니다. 문서 길이는 약 20쪽에서 124쪽이며, 필요한 규칙이 여러 절에 흩어져 있어 검색 한 번으로 해결하기 어렵습니다.
에이전트가 실패하는 세 가지 지점
- 검색 실패: 관련 조항을 찾지 못하거나 비슷한 규칙을 잘못 선택합니다.
- 상태 유지 실패: 작업 초반에 확인한 승인 조건을 후반 도구 호출에서 잊습니다.
- 행동 제약 실패: 규칙을 설명할 수는 있지만 실제 실행에서는 편리한 지름길을 택합니다.
이 문제는 컨텍스트 창을 키우는 것만으로 해결되지 않습니다. 문서를 전부 넣을 수 있어도 어느 규칙이 현재 상태에 적용되는지 판단하고, 각 행동 직전에 다시 확인하는 실행 구조가 없다면 실수가 반복됩니다.

실무 시스템에 적용하는 안전한 패턴
긴 정책 문서를 시스템 프롬프트에 통째로 붙이는 대신, 정책 검색과 행동 검증을 실행 경로에 넣는 편이 안전합니다. 아래처럼 계획, 근거 검색, 권한 검증, 실행, 감사 기록을 분리하면 모델의 기억에만 의존하지 않게 됩니다.
plan = agent.make_plan(request)
rules = policy_store.retrieve(plan, user_role)
decision = policy_engine.validate(plan, rules)
if not decision.allowed:
return escalate(decision.reason)
result = tools.execute(decision.approved_actions)
audit_log.write(plan, rules, decision, result)
중요한 것은 정책 검색 결과에 출처와 버전을 붙이고, 고위험 행동은 실행 직전에 다시 검증하는 것입니다. 승인 금액, 개인 정보 접근, 외부 전송처럼 되돌리기 어려운 작업은 결정론적 정책 엔진이나 사람의 승인을 거치게 해야 합니다. 모델은 판단 보조 역할을 맡되 최종 권한 경계는 코드가 지키는 구조가 좋습니다.
벤치마크를 제품 평가에 활용하는 법
기업이 에이전트를 도입할 때는 성공률 하나만 보지 말고 규칙 검색 정확도, 금지 행동 차단률, 잘못된 승인 요청률, 감사 로그 완전성을 따로 측정해야 합니다. 또한 같은 과제를 정책 문서의 순서와 표현을 바꿔 반복하면 모델이 내용을 이해한 것인지 특정 문구를 외운 것인지 구분할 수 있습니다.
운영 환경에서는 정책이 자주 바뀌므로 버전 회귀 테스트도 필요합니다. 새 지침을 배포하기 전에 기존 과제를 다시 실행해 이전 안전장치가 깨지지 않았는지 확인하고, 실패 사례는 다음 평가 세트에 추가해야 합니다.
정리
HANDBOOK.md가 보여주는 메시지는 명확합니다. 긴 문서를 읽을 수 있다는 사실은 그 규칙을 장시간 안정적으로 준수한다는 뜻이 아닙니다. 신뢰할 수 있는 에이전트에는 더 큰 컨텍스트뿐 아니라 근거 검색, 행동 전 검증, 권한 분리, 감사 기록, 반복 평가가 함께 필요합니다. 앞으로의 경쟁력은 모델이 얼마나 많은 지식을 말하는지가 아니라 실제 업무에서 조직의 경계를 얼마나 일관되게 지키는지에 달려 있습니다.
📰 원본 출처 · https://news.hada.io/topic?id=31994 (#N=31994)
이 글은 GeekNews(긱뉴스)에 게제된 글을 기반으로 작성되었습니다. 원본의 라이선스와 저작권은 원작자에게 있습니다.
'AI 뉴스' 카테고리의 다른 글
| DeepSeek-V4-Flash 업데이트 — 라이트급 모델이 에이전트 벤치마크에서 Pro를 앞선 이유 (0) | 2026.08.01 |
|---|---|
| GPT 5.6 Sol 에이전트에게 실제 사업을 맡겼더니 — 거짓말과 가짜 사용자로 447달러를 잃기까지 (0) | 2026.08.01 |
| Kimi K3 로컬 실행 가이드 — 2.8T 파라미터 오픈 웨이트 모델을 Unsloth GGUF로 돌리는 법 (0) | 2026.07.31 |
| TV 스트리밍 스틱 구매 가이드 — HDMI/Wi-Fi/리모컨 5가지 체크리스트 (0) | 2026.07.31 |
| Gemini Robotics 2, 로봇에 전신 지능을 제공 — 개발자가 알아야 할 핵심 정리 (0) | 2026.07.31 |