AI 뉴스

Qwen3.8-27B, 17~19GB 메모리에서 4-bit 로컬 실행 가능 — 로컬 LLM의 새 기준

노동1호 2026. 8. 15. 19:03

Qwen3.8-27B, 17~19GB 메모리에서 4-bit 로컬 실행 가능 — 로컬 LLM의 새 기준

Qwen 팀이 8월 15일 Qwen3.8-27B 가중치를 Unsloth GGUF/NVFP4로 공개했습니다. 앞선 Qwen3.8 Max에 이어, 이번에는 270억 매개변수의 밀집형(dense) 멀티모달 모델을 24GB 메모리 Mac이나 고용량 GPU 데스크톱에서 바로 돌릴 수 있는 크기로 내렸다는 점이 핵심입니다. 본 글에서는 메모리 요구량, 실행 경로(llama.cpp / Unsloth Desktop / NVFP4), 그리고 코딩·추론 벤치마크 향상분까지 정리합니다.

Qwen3.8-27B 로컬 실행

1. 4-bit 기준 메모리 요구량

Unsloth가 측정한 메모리 맵은 다음과 같습니다. 개인 장비에서 현실적으로 굴릴 수 있는 구간은 4-bit(17~19GB)부터이며, 이를 위해선 24GB 통합 메모리 Mac이나 24GB VRAM GPU가 사실상 최소 조건입니다.

  • 2-bit: 11~13GB
  • 3-bit: 13~16GB
  • 4-bit: 17~19GB
  • 6-bit: 24GB
  • 8-bit: 31GB
  • BF16: 56GB

극단적으로 줄이면 IQ2_XXS가 약 9GB에서 원본 대비 82.5% 정확도를 유지한다고 Unsloth가 측정했지만, 품질을 우선한다면 4-bit 이상이 안정적인 선택지입니다.

2. 실행 경로 — GGUF vs NVFP4

모델을 로컬에서 굴리는 방법은 크게 세 가지입니다.

  • Unsloth Desktop: macOS/Windows/Linux에서 모델 검색/다운로드/실행을 GUI로 처리. RAM 오프로딩과 멀티 GPU를 자동 처리해 입문자에게 가장 쉬움
  • llama.cpp + GGUF: 기존 GPU에서 가장 호환성이 높음. NVFP4를 지원하지 않는 세대(Ada/이전)에서는 사실상 표준
  • NVIDIA Blackwell GPU + NVFP4: RTX 50 시리즈에서는 NVFP4가 BF16 대비 약 1.5배 빠르며 24GB VRAM에서 실행 가능

빠른 시작 — 터미널에서 30초 셋업

# Qwen3.8-27B GGUF 다운로드 (4-bit, Q4_K_M)
cd ~/models
wget https://huggingface.co/unsloth/Qwen3.8-27B-GGUF/resolve/main/Qwen3.8-27B-Q4_K_M.gguf

# llama.cpp로 로컬 서버 실행
./llama-server \
  -m ~/models/Qwen3.8-27B-Q4_K_M.gguf \
  -c 32768 \
  --reasoning-budget high \
  --host 127.0.0.1 --port 8080

# 24GB Mac(M4 Max) 기준 약 19~22 tok/s, Blackwell RTX 5090 기준 ~80 tok/s

3. 컨텍스트·기능: 256K 기본, 1M까지 확장

Qwen3.8-27B는 기본 컨텍스트가 256K이며, YaRN을 적용하면 1M 토큰까지 확장 가능합니다. 비전·추론을 모두 지원하면서 reasoning_effortxhigh / medium / low로 조절해 추론 깊이와 비용을 선택할 수 있다는 점이 27B 구간에서 희소한 강점입니다. 또한 이전 대화의 thinking trace를 유지하는 Preserve Thinking, MTP 기반 빠른 추론, 개선된 도구 호출 파싱이 함께 제공됩니다.

Qwen3.8-27B 추론 컨텍스트

4. 코딩 벤치마크 — Qwen3.6-27B 대비 의미 있는 상승

Unsloth 측정에 따르면 Qwen3.6-27B 대비 다음과 같이 개선됐습니다.

  • Terminal Bench 2.1: 63.4 → 73.0
  • SWE-bench Pro: 53.5 → 61.7
  • LiveCodeBench v6: 83.9 → 90.3
  • CoWorkBench (장시간 업무): 61.0 → 70.7

5. Qwen3.8 라인업에서 27B의 위치

앞서 공개된 Qwen3.8-2.4T-A95B는 1-bit로 줄여도 397GB가 필요했습니다. 즉 최고 성능의 Qwen3.8 자체 호스팅이 목적이라면 2.4T가 대상이지만, Mac/PC에서 코딩·비전·에이전트용 로컬 모델을 실제로 써보려면 27B가 훨씬 현실적입니다. 4-bit 기준 17~19GB 라는 메모리 맵은 24GB 단일 머신으로 운영 가능한 첫 Qwen3.8 라인업이라는 점에서 개인 로컬 LLM의 새 기준이 됩니다.

요약

  • Qwen3.8-27B는 256K 컨텍스트 + 비전 + 추론을 지원하는 27B 밀집형 멀티모달 모델
  • 4-bit 양자화 시 17~19GB로 24GB Mac/RTX 5090에서 실행 가능
  • Unsloth Desktop, llama.cpp GGUF, Blackwell NVFP4 세 경로 모두 지원
  • 코딩 벤치 4종 모두 Qwen3.6-27B 대비 5~10점 상승
  • 2.4T 라인업이 아니라 로컬에서 바로 굴릴 수 있는 Qwen3.8이라는 점이 이번 발표의 핵심

참고: 본문은 GeekNews 토픽 https://news.hada.io/topic?id=32514 의 요약을 기반으로 작성되었습니다.


📰 원본 출처 · https://news.hada.io/topic?id=32514 (#N=32514)

이 글은 GeekNews(긱뉴스)에 게제된 글을 기반으로 작성되었습니다. 원본의 라이선스와 저작권은 원작자에게 있습니다.