도입 — 단일 모델의 한계를 넘어서는 합성 응답
2026년 6월 현재, LLM API 시장에서는 단일 모델의 성능을 높이는 것보다 여러 모델을 합성(synthesize)해 결과를 종합하는 접근이 화제입니다. OpenRouter는 최근 Fusion API를 공개하며, 단일 프롬프트를 여러 전문가 모델로 병렬 분석한 뒤 심판 모델(judge model)이 이를 종합해 최종 답변을 작성하는 멀티 모델 심의(multi-model deliberation) 방식을 도입했습니다. 패널 모델은 웹 검색(web search)과 웹 페치(web fetch)를 활성화한 상태로 작업을 수행하며, 심판 모델은 합의(consensus), 모순(contradictions), 부분적 일치(partial coverage), 고유 통찰(unique insights), 사각지대(blind spots) 다섯 축으로 구조화한 분석을 만듭니다.

이 방식은 리서치, 전문가 비평, 오답 비용이 추가 완성 비용을 상회하는 영역에서 특히 유용합니다. 본 글에서는 OpenRouter Fusion API의 동작 원리, 패널 구성, 가격 모델, 실제 벤치마크 결과, 그리고 활용 패턴까지 정리합니다.
동작 방식 — 단일 프롬프트를 멀티 모델 심의로 전환
Fusion API의 핵심 파이프라인은 네 단계입니다. 첫째, 단일 프롬프트를 소규모 멀티 모델 심의로 변환합니다. 둘째, 전문가 모델 패널이 웹 검색과 웹 페치를 켠 상태로 프롬프트를 병렬 분석합니다. 셋째, 심판 모델이 패널 응답을 종합해 합의·모순·부분 커버리지·고유 통찰·사각지대 다섯 축의 구조화 분석을 생성합니다. 넷째, 심판 모델이 구조화된 분석을 근거로 최종 답변을 작성합니다.
# OpenRouter Fusion API 기본 호출 예시
from openai import OpenAI
client = OpenAI(
base_url="https://openrouter.ai/api/v1",
api_key="sk-or-..."
)
# fusion-alpha 모델 슬러그 사용
response = client.chat.completions.create(
model="openrouter/fusion-alpha",
messages=[{"role": "user", "content": "2026년 6월 기준 한국 AI 산업 트렌드"}],
# 자동 활성화: web search + web fetch
)
print(response.choices[0].message.content)
전체 파이프라인은 서버 사이드에서 실행되므로, 개발자는 일반 모델 호출과 동일한 방식으로 사용할 수 있습니다. 실제 어떤 패널 모델과 심판 모델이 호출되었는지는 OpenRouter의 Activity 페이지에서 확인할 수 있습니다.
패널 구성과 프리셋 — Quality vs Budget
Fusion API의 기본 패널은 Quality 프리셋을 사용합니다. 더 저렴한 모델로 전환하고 싶다면 Budget 프리셋으로 변경할 수 있고, analysis_models 및 model 필드를 직접 지정해 패널과 심판을 완전히 재정의(override)하는 것도 가능합니다.
| 프리셋 | 패널 구성 (예시) | 특징 | 권장 상황 |
|--------|----------------|------|----------|
| Quality | Claude Opus, OpenAI GPT, Google Gemini Pro | 최고 품질 | 리서치, 전략 보고서, 전문가 비평 |
| Budget | Google Gemini Flash, DeepSeek V4 Flash, MoonshotAI Kimi | 최저 비용, 빠른 응답 | 일반 Q&A, 초안 작성, 분류 작업 |
- 컨텍스트 한도는 선택한 모델에 따라 결정*되며, 프리셋에서는 6개 모델이 호출됩니다. 단일 모델이 충분하지 않은 작업(리서치, 전문가 비평, 오답 비용이 큰 결정)에 적합하고, 단순 요약·분류·번역에는 일반 모델 호출이 더 경제적입니다.
벤치마크 — DRACO deep research 과제 100개로 본 실전 성능

OpenRouter는 자사 발표 "Fusion으로 프론티어 성능을 넘어서다"에서 DRACO 벤치마크의 deep research 과제 100개를 측정한 결과를 공개했습니다. 핵심 발견은 다음과 같습니다.
- 패널이 개별 모델을 일관되게 능가: 패널 결과를 융합한 judge 모델이 단독 모델 점수보다 안정적으로 높은 점수를 기록했습니다.
- Fable 5 + GPT-5.5 융합이 69.0%로 단독 Fable 5(65.3%)를 포함해 모든 개별 모델을 능가했습니다.
- 저가형 패널(Gemini 3 Flash + Kimi K2.6 + DeepSeek V4 Pro)이 비용 50% 수준에서 Fable 5 점수에 1% 이내로 근접하면서 GPT-5.5·Opus 4.8 같은 대형 모델을 능가했습니다.
- Opus 4.8을 자기 자신과 융합한 경우에도 65.5%로 단독(58.8%) 대비 6.7점 상승 → 합성 단계 자체의 효과를 확인했습니다.
흥미로운 부수 발견도 있습니다. 패널 모델이 채점 루브릭을 온라인에서 검색하는 오염 위험이 발견되었는데, OpenRouter는 web search·web fetch 제외 목록을 한 줄 설정으로 적용해 차단할 수 있도록 했습니다. 평가의 신뢰성이 중요한 벤치마크 환경에서는 이 옵션이 필수입니다.
가격 모델 — 개별 완성 합산 청구
Fusion API의 가장 큰 주의점은 가격 모델입니다. 패널 구성원 전원과 심판 호출을 모두 실행하므로, 요청 비용은 단일 모델 기준이 아닌 개별 완성(completion)의 합산으로 책정됩니다.
예를 들어 Quality 프리셋(6개 모델)을 사용하면 단일 모델 호출 대비 약 5~7배 비용이 발생할 수 있습니다. Budget 프리셋은 이 비용을 절반 이하로 줄여주며, 실제 비용은 Activity 페이지에서 모델별로 정확히 확인할 수 있습니다.
따라서 Fusion API는 다음 조건을 모두 만족할 때 사용하는 것이 합리적입니다.
- 오답 비용이 크다 — 잘못된 답이 비즈니스 손실·평판 손상·법적 문제로 이어지는 경우
- 추가 완성 비용을 상회할 만큼 가치가 있다 — 리서치 보고서, 전략 분석, 의사결정 지원
- 장기 컨텍스트가 필요 없다 — Fable 5 같은 long-horizon 과제에는 Fable 5를 직접 호출하는 것이 더 적합합니다
Fable 5의 drop-in 대체재가 아니라는 점도 명시되어 있습니다. Fable 5가 강점을 보이는 long-horizon 과제는 포함되지 않으며, 코딩에서는 선택적 호출 도구로 활용하는 패턴이 권장됩니다.
사용 방법 — 4가지 진입점
OpenRouter Fusion API는 4가지 사용 방법을 제공합니다.
- Chatroom — 코드 없이 OpenRouter 웹 UI에서 패널 심의 결과를 바로 확인
- Model slug — 기존 OpenAI 호환 호출에서
openrouter/fusion-alpha같은 슬러그로 문자열 교체만으로 사용 - Server tool — 패널 구성, 시스템 프롬프트, judge 모델을 최고 수준으로 제어하고 싶을 때 사용
- Plugin — 특정 패널 모델 지정 등 플러그인 방식의 커스터마이징
# 플러그인 방식으로 패널을 직접 지정
response = client.chat.completions.create(
model="openrouter/fusion-alpha",
messages=[...],
extra_body={
"fusion": {
"analysis_models": [
"anthropic/claude-opus-4.8",
"openai/gpt-5.5",
"google/gemini-pro-3"
],
"model": "anthropic/claude-opus-4.8" # judge 모델
}
}
)
전망 — 합성 모델 시대의 시작
2026년 6월 기준으로 LLM API 시장은 모델 자체의 성능 향상보다 합성(synthesis)을 통한 응답 품질 개선으로 무게중심이 이동하고 있습니다. OpenRouter Fusion API는 그 첫 번째 상용 구현 중 하나이며, DRACO 벤치마크의 deep research 과제에서 단일 모델 대비 일관된 성능 우위를 입증했습니다.
앞으로는 judge 모델의 자체 평가 편향 보정, 패널 모델 간 다중 라운드 심의, 그리고 비용 최적화된 동적 패널 선택이 다음 단계로 예상됩니다. 단일 모델의 한계가 명확한 리서치·분석·전략 영역에서는 Fusion 같은 합성 호출이 표준이 될 가능성이 높습니다. 2026년 후반기에는 "어떤 모델을 쓸까"보다 "어떤 패널을 구성할까"가 더 중요한 의사결정이 될 것입니다.
함께 보면 좋은 자료
- OpenRouter (오픈라우터): 통일된 LLM 인터페이스와 마켓플레이스
- OpenRouter, 1억 1,300만 달러 Series B 유치
- 무료 AI API를 찾아주는 CLI 도구 — frouter
- OpenRouter + Claude Code Router = Claude Code Mux
- AI를 무료 또는 저렴하게 활용하여 개발하는 방법
요약
- Fusion API는 단일 프롬프트를 여러 전문가 모델로 병렬 분석한 뒤 judge 모델이 종합하는 멀티 모델 심의 방식
- Quality 프리셋(Claude Opus·OpenAI GPT·Gemini Pro)과 Budget 프리셋(Gemini Flash·DeepSeek V4 Flash·Kimi)을 제공하며 플러그인으로 완전 재정의 가능
- DRACO 벤치마크 deep research 100개 과제에서 Fable 5+GPT-5.5 융합이 69.0%로 단독 Fable 5(65.3%) 능가
- 저가형 패널이 비용 50% 수준에서 Fable 5 점수에 1% 이내로 근접하며 GPT-5.5·Opus 4.8 능가
- Opus 4.8 자기 자신과의 융합도 65.5%로 단독(58.8%) 대비 6.7점 상승 — 합성 단계 자체의 효과 확인
- 가격은 개별 완성 합산으로 책정되므로 오답 비용이 큰 리서치·전문가 비평·의사결정 지원에 적합
- Chatroom·Model slug·Server tool·Plugin 4가지 진입점 제공, Fable 5의 drop-in 대체재는 아님
'AI 뉴스' 카테고리의 다른 글
| SpaceX, 600억 달러(약 90조원)에 Cursor 개발사 Anysphere 인수 (0) | 2026.06.18 |
|---|---|
| Claude Code 수석 디자이너의 AI 빌드 워크플로우 — worktree·auto mode·prototype skill 실전 정리 (0) | 2026.06.18 |
| 에이전틱 코드 리뷰 — AI 시대, 검증 단계가 진짜 병목이 된 이유 (0) | 2026.06.17 |
| Show GN: Anf — Claude로 만든 새로운 macOS Finder 가이드 (0) | 2026.06.17 |
| 연구자들 "Fable 5 논란은 탈옥이 아니라 'fix this code'에서 시작됐다" — 2026년 6월 (0) | 2026.06.17 |