Tokenomics: 에이전트형 소프트웨어 엔지니어링에서 토큰이 어디로 새는지 정량화
에이전트형 코딩 자동화가 현장에 들어오면서, 비용을 예측하기가 더 어려워졌습니다. 어디서 토큰이 새는지 모르면 예산을 세울 수 없기 때문입니다. ChatDev와 GPT-5로 30개 태스크를 추적한 arxiv 연구가 그 답을 한 장의 비용 지도로 정리했습니다.
핵심 발견: 코드 리뷰 단계가 토큰의 59.4%를 먹는다
연구의 첫 번째 발견은 단순하지만 강력합니다. 초기 코드 생성이 아니라 검증과 리뷰 단계가 비용의 본진이라는 점입니다. 30개 태스크 평균에서 코드 리뷰는 59.4%를 차지했고, 문서화는 20.1%, 테스트는 10.3%에 그쳤습니다. 설계(2.4%)와 코딩(8.6%)은 의외로 적습니다.
에이전트 협업은 본질적으로 대화형입니다. 프로그래머 에이전트와 리뷰어 에이전트가 같은 코드를 여러 번 주고받으며 다듬는 구조라, 전체 컨텍스트가 반복적으로 전송됩니다. 작은 수정에도 전체 파일이 매번 왕복하기 때문에 비용이 선형보다 빠르게 누적됩니다.
입력 토큰이 53.9%: communication tax의 실체
두 번째 발견은 토큰 구성의 비대칭입니다. 전체 평균은 입력 53.9%, 출력 24.4%, 추론 21.6% 로, 입력과 출력이 거의 2대 1입니다. 에이전트 간 협업의 "communication tax"가 실증적으로 드러난 결과입니다.
다만 단계별로 결이 다릅니다. 코딩 단계는 출력이 58.0%로 압도적입니다. 간결한 명세에서 장문 코드를 뽑아내야 하기 때문이죠. 반면 문서화 단계는 입력이 80.2%입니다. 기존 코드를 통째로 읽고 짧은 매뉴얼을 만들어내는 구조라, 컨텍스트 소비가 핵심입니다. 코드 리뷰는 입력 51.4%, 테스트는 입력 60.8%로 검증 단계 전반이 입력 중심입니다.
단계별 토큰 프로필로 비용을 미리 그릴 수 있다
이 데이터가 실무자에게 주는 가치는 "비용 지도"입니다. 그린필드 프로젝트는 코딩 비중이 크니 출력 토큰 비용이 예상됩니다. 반면 리팩터링과 디버깅 중심 프로젝트는 코드 리뷰 사이클이 비용을 지배하니 입력 토큰, 즉 컨텍스트 길이가 핵심 변수가 됩니다.
같은 에이전트 시스템이라도 작업 유형에 따라 비용 구조가 180도 다릅니다. "에이전트가 비싸다"는 막연한 인상보다, "이 단계가 이만큼 차지한다"는 숫자로 추정하는 편이 예산 산출에 훨씬 유용합니다.
실전 팁: human-in-the-loop을 코드 리뷰 전에 끼워 넣어라
연구진이 제안하는 가장 현실적인 최적화는 코드 리뷰 단계 직전에 사람 체크포인트를 두는 것입니다. 자동 리뷰 루프가 깊어지기 전에 사람이 방향을 잡아주면, 같은 수정을 여러 번 반복하는 비효율을 끊을 수 있습니다. 한 번의 인간 개입으로 3~5회의 에이전트 대화를 줄일 수 있다면 ROI는 명확합니다.
또한 증분 컨텍스트 전달 패턴이 필요합니다. 매번 전체 파일을 보내지 말고, 변경된 부분과 관련 모듈만 추려 보내는 방식이 communication tax를 직접 줄입니다. ChatDev의 "chat chain"은 단계가 명확해 매핑이 쉽지만, 컨텍스트 절약 측면에서는 아직 개선 여지가 큽니다.
그래서 우리도 따라 할 수 있는가
이 연구는 단일 프레임워크(ChatDev)와 단일 모델(GPT-5 reasoning) 결과라는 한계가 있습니다. MetaGPT, AutoGen, CrewAI 같은 다른 LLM-MA 아키텍처는 다른 토큰 분포를 보일 가능성이 높습니다. 다만 "검증 단계가 비싸다"는 결론은 다중 에이전트 시스템의 공통 특성이므로, 다른 프레임워크로 확장해도 정성적 경향은 유지될 가능성이 큽니다.
현업에 적용할 때는 세 가지만 기억하면 됩니다. 첫째, 단계별 토큰 비율을 직접 측정하라. 둘째, 리팩터링 프로젝트는 human-in-the-loop을 일찍 넣어라. 셋째, communication tax를 줄이는 협업 프로토콜 개선이 향후 1년의 핵심 최적화 영역이다. 토큰은 한 번 쓰면 환불되지 않으므로, 어디로 새는지 아는 것이 곧 비용을 아는 일입니다.
'AI 뉴스' 카테고리의 다른 글
| 1인 앱 개발을 위한 React Native + Expo 베이스 템플릿 — FSD 구조와 AI Agent Harness로 완성하는 생산 라인 (0) | 2026.06.09 |
|---|---|
| DeepSeek V4 Pro, 정밀도에서 GPT-5.5 Pro를 앞서다 (0) | 2026.06.09 |
| C로 장난치기, &((int*)-8)[3] 편 — 토큰 예측 능력 연마용 코드 조각 읽기 (0) | 2026.06.09 |
| Shortcat - 마우스없이 키보드로 맥 전체 제어하기 완벽 가이드 (0) | 2026.06.09 |
| Claude Desktop의 공식 Linux 빌드 요청 — 개발자가 알아야 할 핵심 정리 (0) | 2026.06.09 |