AI 뉴스

Qwen 3.6 27B — 로컬 개발의 새로운 스윗 스폿

노동1호 2026. 7. 1. 00:01

> 27B dense 모델이 35B A3B MoE보다 느리지만, 코드 품질·제약 준수·에이전트 코딩 환경 구성에서 더 강한 선택지로 떠오르고 있습니다. llama.cpp + 8-bit GGUF + MTP 조합이면 Macbook Max M5 128GB에서 32 tok/s로 실전 운용이 가능합니다.

qwen local model code developer

도입 — 로컬 LLM의 "체급 이상" 선택지

로컬에서 LLM을 굴리던 개발자들 사이에서 Qwen 3.6 27B가 빠르게 화제입니다. 35B A3B(MoE)보다 추론 속도는 느리지만, dense 모델답게 코드 생성·도구 호출·긴 컨텍스트 작업에서 더 안정적인 결과를 보여주기 때문입니다. Artificial Analysis 기준 37점으로 mid-2025년 GPT-5·Claude Sonnet 4.5급 성능을 내며, 민감 데이터·오프라인 작업·자체 호스팅이 필요한 시나리오에 실용적인 옵션이 되었습니다.

Qwen 3.6 라인업은 두 가지로 나뉩니다.

  • Qwen 3.6 35B A3B — mixture-of-experts 모델. 더 빠르지만 가끔 지시를 무시하고 단일 index.html로 결과를 뭉뚱그리는 경향이 있습니다.
  • Qwen 3.6 27B — dense 모델. "체급 이상으로 성능을 낸다"는 평가가 많고, OpenCode에서 pnpm 기반 육각형 지뢰찾기를 단일 프롬프트로 Node 패키지 형태로 생성해내는 등 지시 준수율이 높습니다.

핵심 — 왜 27B가 35B A3B보다 나을 때가 있는가

제약 조건 준수

Qwen 3.6 27B는 창작·코딩 테스트에서 제약 조건 준수가 강점으로 드러납니다. 35B A3B는 "패키지로 만들어라"라는 명시적 지시를 무시하고 단일 HTML로 결과를 내는 경우가 있는데, 27B는 요청한 모듈 구조·파일 분리·테스트 케이스까지 그대로 살려냅니다.

Artificial Analysis 37점

벤치마크 점수만 보면 35B A3B도 비슷한 35~38점대입니다. 하지만 코딩·도구 호출 세부 항목에서 27B가 일관되게 앞서며, 특히:

  • 첫 시도 코드 품질 (Rust, C++, C# 기준)
  • 사고·계획 단계의 추론 깊이
  • 도구 호출 시 함수 시그니처 정확도

이 차이는 vibe coding 환경에서 바로 체감됩니다. 한 사용자는 "Qwen은 빨라서 사고·계획에 좋고, Gemma4는 첫 시도 코드 품질이 훨씬 좋다"고 분리해서 쓰는 패턴을 보고하기도 했습니다.

실전 — llama.cpp + GGUF + MTP 구성

서버 실행 한 줄


llama-server -hf unsloth/Qwen3.6-27B-MTP-GGUF:Q8_0 \
    --spec-type draft-mtp -ngl 999 -fa on -c 65536 --port 8080

각 인자 의미:

  • -hf unsloth/Qwen3.6-27B-MTP-GGUF:Q8_0 — Hugging Face에서 8-bit 양자화 모델을 받아 캐싱
  • --spec-type draft-mtpmulti-token prediction으로 추론 속도 향상
  • -ngl 999 — 모든 레이어를 GPU에 적재
  • -fa on — flash attention 활성화
  • -c 65536 — 64k 토큰 컨텍스트 (네이티브는 256k)

8-bit 양자화는 품질 손실을 거의 만들지 않으면서 모델 크기를 절반으로 줄여 줍니다. 4-bit·3-bit로 더 낮추면 더 작고 빨라지지만, 코드 생성 품질에서 손실이 누적됩니다.

OpenCode 연결

~/.config/opencode/opencode.jsonc:


{
  "$schema": "https://opencode.ai/config.json",
  "provider": {
    "llama": {
      "name": "llama.cpp (local)",
      "npm": "@ai-sdk/openai-compatible",
      "options": {
        "baseURL": "http://127.0.0.1:8080/v1",
        "apiKey": "***"
      },
      "models": {
        "qwen3.6-27b": { "name": "Qwen3.6-27B Q8 +MTP" }
      }
    }
  },
  "model": "llama/qwen3.6-27b"
}
qwen local model code developer

이렇게 두면 같은 llama-server 인스턴스를 에이전트 코딩(OpenCode) + 터미널 채팅 양쪽으로 재사용할 수 있습니다.

하드웨어 가이드

Apple Silicon

Macbook Max M5 128GB에서의 측정값:

| 모델 | 백엔드 | 속도 | RAM 사용 |

|---|---|---|---|

| Qwen3.6-35B-A3B 8-bit | MLX | 85 tok/s | 37GB |

| Qwen3.6-35B-A3B 8-bit | llama.cpp | 93 tok/s | 44GB |

| Qwen3.6-35B-A3B 8-bit | llama.cpp + MTP | 105 tok/s | 45GB |

| Qwen3.6-27B 8-bit | llama.cpp + MTP | 32 tok/s | 42GB |

27B는 35B A3B보다 느리지만, 코드 품질이 더 좋아서 결국 27B가 선호된다는 평가가 많습니다.

전용 GPU가 통합 메모리보다 유리

Ryzen AI Max 395, Mac 통합 메모리, DGX Spark 같은 장비는 MoE·소형 모델에는 강하지만 밀집(dense) 모델에서는 전용 GPU가 훨씬 빠릅니다. Qwen 3.6 27B를 본격적으로 굴리려면 3090 두 장 + 64~128GB DDR4 + PCIe 4 메인보드 조합이 현재 $3k 안팎의 스윗 스폿으로 자주 거론됩니다.

512GB VRAM이 필요 없는 대부분의 로컬 코딩 워크로드에서는 Intel Arc Pro B50/B60/B70이 가성비 절충안이 될 수 있습니다. 32GB VRAM을 M5 Max급 가격의 1/3에 얻을 수 있고, Vulkan 백엔드에서 llama.cpp가 안정적으로 동작합니다.

전망 — 27B dense의 위상

  • 민감 데이터·오프라인 작업 — 클라우드 API 반출이 금지된 사내 코드·의료·금융 도메인에서 1차 선택지
  • 에이전트 코딩 — OpenCode, aider, Claude Code 호환 인터페이스로 vibe coding 환경 구성
  • 자체 호스팅·회수 불가능한 모델 — 모델 제공사 정책 변경에 영향받지 않는 자체 인프라
  • 저전력 옵션 — Apple Silicon 통합 메모리에서 fan noise 감수만 가능하다면 mid-tier 노트북으로도 가동

요약

  1. Qwen 3.6 27B는 35B A3B보다 느리지만, 코드 품질·지시 준수율·에이전트 코딩에서 우위
  2. llama.cpp + 8-bit GGUF + MTP 조합이면 Macbook Max M5 128GB에서 32 tok/s로 실전 운용 가능
  3. OpenCode에 baseURL: http://127.0.0.1:8080/v1 한 줄 추가로 vibe coding 환경 즉시 구성
  4. 전용 GPU(3090 2장 또는 Intel Arc Pro B70) 가성비가 통합 메모리보다 dense 모델에 유리
  5. 민감 데이터·오프라인·자체 호스팅 워크로드에서 mid-2025 frontier급 37점 성능을 로컬에서

> 참고 링크: Qwen 3.6 27B (HF) · unsloth GGUF · llama.cpp · OpenCode 설정