들어가며: 에이전트 검색의 비용 문제
GPT-5.6 Sol 기반 다중 턴 검색은 요청당 비용이 만만치 않다. 반복적인 계획·재검색 루프가 깊어질수록 토큰 사용량이 선형적으로 증가해, 운영 환경에서 매월 수만 달러를 소모하는 사례가 보고되고 있다. 이런 배경에서 등장한 Castform은 4B 파라미터의 오픈 소스 모델로, 강화학습 후처리(RL post-training)만으로 GPT-5.6 Sol과 같은 수준의 검색 정확도를 달성하면서 비용은 100분의 1로 낮춘다고 주장한다.
Castform: 4B 모델로 Sol 급 정확도를 내는 방법
Castform의 핵심은 두 가지다. 첫째, 단일 임베딩 검색에 의존하지 않고 계획 → 검색 → 재계획을 명시적으로 오가며 multi-turn 검색 흐름을 학습한다. 둘째, 검색 정확도와 비용 사이의 trade-off를 보상 설계에 직접 반영해 불필요한 호출을 줄이는 방향으로 정책을 수렴시킨다. 결과적으로 같은 정답률이라도 호출 횟수가 절반 이하로 떨어져 inference 비용이 한 자릿수로 줄어든다.
from transformers import AutoModelForCausalLM, AutoTokenizer
import torch
model_id = "castform-4b-search"
tok = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
model_id, torch_dtype=torch.bfloat16, device_map="auto"
)
def plan_and_search(query, retriever, max_steps=4):
state = {"query": query, "evidence": []}
for step in range(max_steps):
prompt = build_prompt(state)
action = model.generate(**tok(prompt, return_tensors="pt").to(model.device), max_new_tokens=128)
text = tok.decode(action[0], skip_special_tokens=True)
if "ANSWER" in text:
return parse_answer(text)
doc = retriever.search(parse_query(text))
state["evidence"].append(doc)
return state["evidence"][0] if state["evidence"] else None
# Castform은 위 루프를 RL로 학습해 호출 횟수 대비 정확도를 극대화한다
실용 팁: 기존 에이전트 파이프라인에 도입할 때
1. 검색 도구 인터페이스부터 정리한다. Castform은 명시적인 plan/search/done 액션을 토큰으로 출력하기 때문에 retriever API가 결정적(deterministic)이어야 한다. 2. 프롬프트 포맷을 huggingface에 공개된 chat template 그대로 쓴다. 자체 포맷으로 수정하면 분포가 어긋나 성능이 급락한다. 3. GPU 자원이 제한적이면 4-bit 양자화(예: bitsandbytes NF4)로도 정확도 손실이 2%p 이내로 유지된다. 4. A/B 테스트 시에는 동일 쿼리 셋에 대해 호출 횟수 + 정답률 + p95 latency를 함께 기록한다. 호출 횟수가 절반만 줄어도 inference 비용은 60% 이상 떨어진다.
전망: 오픈 모델로 가는 검색 에이전트
Castform의 결과는 "큰 모델이 모든 것을 해결한다"는 가정에 균열을 낸다. 강화학습 후처리만 잘 설계하면 4B급 모델도 검색 도메인에서 독점 모델과 동등한 정확도를 낼 수 있다는 점이 핵심이다. 앞으로 도구 호출 도메인(웹 검색, SQL 실행, 코드 실행)에 특화된 소형 오픈 모델들이 비슷한 recipe로 등장할 가능성이 높고, API 비용에 민감한 팀은 우선 후보로 검토할 만하다.
요약
- Castform 4B는 강화학습으로 GPT-5.6 Sol급 검색 정확도를 달성한다.
- 비용은 약 100분의 1, 호출 횟수도 절반 이하로 줄어든다.
- 기존 에이전트 파이프라인에 도구 인터페이스 정리 + chat template 그대로 + 양자화 옵션으로 즉시 도입 가능하다.


📰 원본 출처 · https://news.hada.io/topic?id=32204 (#N=32204)
이 글은 GeekNews(긱뉴스)에 게제된 글을 기반으로 작성되었습니다. 원본의 라이선스와 저작권은 원작자에게 있습니다.