AI 뉴스

Hugging Face에 공개된 Kimi-K3 — 2.8조 매개변수 네이티브 멀티모달 에이전트 모델의 모든 것

노동1호 2026. 7. 28. 23:03

Hugging Face에 공개된 Kimi-K3 — 2.8조 매개변수 네이티브 멀티모달 에이전트 모델의 모든 것

요약: Kimi K3는 2.8조 개 매개변수와 104만 8,576토큰 컨텍스트를 갖춘 오픈 가중치 네이티브 멀티모달 에이전트 모델로, 장시간 코딩·지식 작업·추론을 지원함 Kimi Delta Attention(KDA), Attention Residuals, Stable LatentMoE를 결…

2026년 7월, Moonshot AI가 공개한 Kimi K3는 기존 오픈 가중치 LLM의 한계를 한 단계 끌어올린 모델이다. 2.8조(2.8T) 매개변수와 104만 8,576토큰(1M+ context) 컨텍스트 윈도우를 갖춘 네이티브 멀티모달 에이전트 모델로, 텍스트·이미지·오디오·비디오를 단일 토큰 스트림으로 처리한다. Hugging Face에 오픈 가중치로 공개되어 상용利用이 가능하다.

1. Kimi K3의 핵심 아키텍처: KDA와 Stable LatentMoE

Kimi K3는 세 가지 핵심 기술 혁신을 결합했다:

  • Kimi Delta Attention (KDA): 기존 multi-head attention의 KV 캐시 비용을 선형 복잡도로 줄인 변형. 1M 컨텍스트에서도 메모리 사용량을 실용 수준으로 유지한다.
  • Attention Residuals: 깊은 트랜스포머의 gradient 흐름을 안정화해 80+ 레이어 학습이 가능하다.
  • Stable LatentMoE: 라우팅 불안정성을 줄이고 전문가 다양성을 보존하는 Mixture-of-Experts 변형. 전체 2.8T 매개변수 중 활성화 비율은 약 12% 수준이라 추론 비용이 실용적이다.

2. 성능 벤치마크: 추론·코딩·멀티모달에서 동급 SOTA

Moonshot AI가 공개한 리더보드 기준 Kimi K3는 다음 영역에서 동급 모델 대비 우위를 보인다:

  • 장시간 코딩 에이전트: SWE-Bench Verified 78.4%, Multi-SWE-Bench 71.2% — Claude 4.5 Opus급 추격.
  • 지식 작업: GPQA Diamond 81.7%, MMLU-Pro 88.9% — 추론 모델군 최상위.
  • 네이티브 멀티모달: OCRBench 92.1%, VideoMME 79.4% — 텍스트와 동등한 토큰 스트림으로 영상 이해.
  • 1M 컨텍스트 실용성: RULER 1M 90.3% — 사실상 검색 없는 장문 이해 가능.

Kimi K3 아키텍처 다이어그램

3. Hugging Face 공개 가중치와 로컬 실행 가이드

Kimi K3는 moonshotai/Kimi-K3-Instruct 리포지토리에 Hugging Face 표준 형식으로 공개되어 있다. 다음은 vLLM으로 로컬 서빙을 띄우는 예시다:

# 1. 의존성 설치 (CUDA 12.4+ 권장)

pip install vllm>=0.9.0 transformers==4.52.0

2. vLLM 서빙 시작 (4×H100 80GB 또는 8×A100 80GB)

vllm serve moonshotai/Kimi-K3-Instruct \

  • -tensor-parallel-size 4 \
  • -max-model-len 1048576 \
  • -gpu-memory-utilization 0.92 \
  • -enable-prefix-caching

3. OpenAI 호환 API로 호출

curl http://localhost:8000/v1/chat/completions \

  • H "Content-Type: application/json" \
  • d '{"model":"moonshotai/Kimi-K3-Instruct","messages":[{"role":"user","content":"1M 컨텍스트 테스트"}],"max_tokens":4096}'

4. 다른 오픈 가중치 모델과의 포지셔닝

2026년 상반기 기준 오픈 가중치 거대 모델 군은 다음 구도로 정리된다:

  • DeepSeek V4 (671B, MoE): 추론 특화, API 가격 최저.
  • Qwen 3.6-27B (dense): 경량 로컬 추론, 24GB VRAM 단일 GPU.
  • Llama 4 Behemoth (2T, MoE): 메타의 범용 거대 모델.
  • Kimi K3 (2.8T, MoE): 네이티브 멀티모달 + 1M 컨텍스트 + 에이전트 최적화.

Kimi K3의 차별점은 에이전트 워크플로우에 있다. KDA의 선형 복잡도와 Attention Residuals의 안정성이 결합되어, 1000-step 이상의 멀티툴 호출 루프에서도 컨텍스트 손실이 거의 없다.

5. 실전 활용 시 주의사항

  • VRAM 4×H100 80GB 최소: 2.8T 전체 로드는 사실상 데이터센터급. 양자화(AWQ/GPTQ 4-bit) 시 8×A100 80GB로 가능.
  • 라우팅 최적화: Stable LatentMoE의 활성 전문가 수는 12%지만, 특정 도메인 편중 시 더 많은 expert가 활성화될 수 있어 회귀 테스트가 필수.
  • 멀티모달 입력 형식: 이미지/PDF/오디오 모두 동일 토큰 스트림이지만, 입력 토큰 합계가 1M을 넘으면 잘림 — 청크 분할 필수.
  • 프롬프트 캐싱: 1M 컨텍스트의 prefix caching은 KV 캐시 50GB+ 차지. vLLM --enable-prefix-caching + 디스크 오프로드 권장.

Kimi K3 추론 벤치마크 차트

6. 전망: 에이전트 시대의 오픈 가중치

Kimi K3의 공개는 2026년 하반기 오픈 가중치 생태계의 방향을 명확히 보여준다. 단순한 챗봇 성능 경쟁에서 장시간 자율 실행 가능한 에이전트 + 네이티브 멀티모달로 이동하고, 컨텍스트 윈도우가 1M을 기본값으로 잡았다. Hugging Face를 통한 즉시 로컬 서빙이 가능한 점은 API 종속을 줄이고 자체 호스팅 워크플로우를 강화한다. 향후 6개월 내 동급 경쟁 모델이 다수 등장할 가능성이 높고, 멀티모달 + 1M 컨텍스트는 곧 표준 사양이 될 것으로 보인다.

요약

  • Kimi K3 = 2.8T 매개변수, 1M+ 컨텍스트, 네이티브 멀티모달 MoE 모델
  • KDA + Attention Residuals + Stable LatentMoE의 3중 아키텍처 혁신
  • SWE-Bench 78.4%, GPQA 81.7% 등 동급 SOTA
  • Hugging Face 오픈 가중치, vLLM으로 즉시 로컬 서빙 가능
  • 에이전트 워크플로우 최적화, 1000-step 멀티툴 호출 안정


출처: https://news.hada.io/topic?id=31893


📰 원본 출처 · https://news.hada.io/topic?id=31893 (#N=31893)

이 글은 GeekNews(긱뉴스)에 게제된 글을 기반으로 작성되었습니다. 원본의 라이선스와 저작권은 원작자에게 있습니다.