AI 뉴스

Kimi K2.7-Code: 토큰 효율이 개선된 오픈소스 코딩 모델 — 2026년 6월 완전 가이드

노동1호 2026. 6. 13. 20:02

2026년 6월 현재, Moonshot AI가 오픈소스 코딩 모델의 새 기준을 제시했다. Kimi K2.7-Code는 K2.6 기반에서 사고 토큰을 30% 절감하면서 코딩·에이전트 벤치마크를 모두 끌어올렸다. 본문은 6개 섹션으로 모델 구조, 벤치마크, 배포, 사용 패턴, 라이선스, 운영자용 가드레일을 다룬다.

kimi moonshot ai code

모델 구조 — MoE 1T와 256K 컨텍스트

Kimi K2.7-Code는 Mixture-of-Experts(MoE) 아키텍처다. 총 파라미터는 1T, 활성 파라미터는 32B로 설계됐다. 레이어 61개 중 Dense 레이어는 1개이며, Attention Hidden Dimension은 7168, MoE Hidden Dimension은 전문가당 2048이다. Attention Head 64개, Expert 384개, 토큰당 선택 Expert 8개, Shared Expert 1개로 구성된다. 어휘 크기는 160K, 컨텍스트 길이는 256K다. Attention 메커니즘은 MLA, 활성화 함수는 SwiGLU다. 비전 인코더 MoonViT는 400M 파라미터로 이미지 입력을 담당한다. 이미지-텍스트 동시 입력과 Transformers·Safetensors·conversational·custom_code 태그를 함께 제공한다. 비디오 입력은 공식 API에서만 실험적으로 지원된다.

평가 결과 — K2.6 대비 30% 사고 토큰 절감

Kimi Code Bench v2는 50.9에서 62.0으로 올랐다. Program Bench는 48.3에서 53.6, MLS Bench Lite는 26.7에서 35.1로 상승했다. 에이전트 벤치마크도 동시에 개선됐다. Kimi Claw 24/7 Bench는 42.9에서 46.9, MCP Atlas는 69.4에서 76.0, MCP Mark Verified는 72.8에서 81.1로 뛰었다. 동일 작업에서 사고 토큰을 약 30% 줄였다. 평가 조건은 Kimi Code CLI의 Thinking 모드, temperature 1.0, top-p 0.95, 262,144 토큰 컨텍스트 길이다. GPT-5.5는 Codex xhigh, Opus 4.8은 Claude Code xhigh로 실행됐다. GPT-5.5의 MCP Mark Verified 92.9와 Opus 4.8의 76.4가 상한선 역할을 한다.

Native INT4 양자화와 배포 옵션

kimi moonshot ai code

K2.7-Code는 K2-Thinking과 같은 native int4 양자화를 채택했다. 공식 API는 platform.moonshot.ai에서 접근하며 OpenAI·Anthropic 호환 인터페이스를 제공한다. 권장 추론 엔진은 vLLM, SGLang, KTransformers다. K2.5·K2.6과 같은 아키텍처라 기존 배포 스크립트를 재사용할 수 있다. transformers 버전은 4.57.1 이상 5.0.0 미만이다. vLLM은 pip install vllm 후 vllm serve "moonshotai/Kimi-K2.7-Code"로 8000 포트 OpenAI 호환 엔드포인트를 연다. SGLang은 python3 -m sglang.launch_server로 30000 포트를 연다. Docker Model Runner는 docker model run hf.co/moonshotai/Kimi-K2.7-Code로 한 줄 실행이 가능하다. 배포 가이드는 Model Deployment Guide에서 확인할 수 있다.

사용 패턴 — Thinking 강제와 멀티모달

사용 시 Thinking과 preserve_thinking이 True로 강제된다. 권장 temperature는 1.0, top_p는 0.95다. Instant 모드는 지원되지 않는다. Chat Completion은 openai 클라이언트의 client.chat.completions.create로 max_tokens=4096을 설정한다. 응답에서 response.choices[0].message.reasoning과 content를 함께 사용한다. 이미지 입력은 base64 인코딩 후 image_url에 전달하고 max_tokens=8192로 생성한다. 비디오 입력은 mp4를 base64로 인코딩해 video_url에 전달한다. preserve_thinking은 멀티턴에서 전체 reasoning을 유지해 코딩 에이전트 시나리오 성능을 끌어올린다. Interleaved Thinking과 Multi-Step Tool Call 설계는 K2 Thinking 문서를 참조한다. 공식 코딩 에이전트 프레임워크는 Kimi Code CLI(kimi.com/code)다.

라이선스 — Modified MIT와 광고 조항

코드 저장소와 모델 가중치는 Modified MIT License로 배포된다. 사실상 MIT에 BSD 스타일 광고 조항을 결합한 형태다. 월간 활성 사용자나 매출과 무관하게 제품에 쓸 경우 "광고" 표시를 요구한다. About 섹션의 크레딧에 사용 사실을 명시하는 수준이다. Cursor 저격 조항으로 해석하는 시각도 있다. "공개하라고 망신 주게 만들지 말라"는 메시지라는 분석이다. 사용자 인터페이스 정의의 법률 문구는 다소 미흡하다는 평가가 Hacker News 토론에서 나왔다. 조직에서 도입할 경우 법무팀 검토를 권장한다.

운영자용 가드레일

K2.7-Code는 K2.5·K2.6에서 보이던 "실패한 테스트를 기존 실패로 착각하고 주석 처리하는" 패턴을 줄였다는 평가가 있다. 다만 주석 처리된 테스트가 빌드를 깨도록 명시적으로 만드는 안전장치는 여전히 유효하다. 비디오 입력은 공식 API에서만 실험 지원되므로 서드파티 vLLM/SGLang API에서는 이미지까지만 활용한다. preserve_thinking은 비활성화할 수 없으므로 reasoning_content 미지원 API에서는 reasoning 필드로 폴백한다. API 사용료는 사설 보고 기준 5~10달러 사이로 책정된다. K2.6 대비 토큰 30% 절감은 비용 최적화 모델이 아니라 품질-비용 균형 모델로 자리 잡았다. 2026년 6월 현재 오픈 가중치 코딩 모델의 새 기준점은 K2.7-Code다.