Qwen3.8-27B, 17~19GB 메모리에서 4-bit 로컬 실행 가능 — 로컬 LLM의 새 기준
Qwen 팀이 8월 15일 Qwen3.8-27B 가중치를 Unsloth GGUF/NVFP4로 공개했습니다. 앞선 Qwen3.8 Max에 이어, 이번에는 270억 매개변수의 밀집형(dense) 멀티모달 모델을 24GB 메모리 Mac이나 고용량 GPU 데스크톱에서 바로 돌릴 수 있는 크기로 내렸다는 점이 핵심입니다. 본 글에서는 메모리 요구량, 실행 경로(llama.cpp / Unsloth Desktop / NVFP4), 그리고 코딩·추론 벤치마크 향상분까지 정리합니다.

1. 4-bit 기준 메모리 요구량
Unsloth가 측정한 메모리 맵은 다음과 같습니다. 개인 장비에서 현실적으로 굴릴 수 있는 구간은 4-bit(17~19GB)부터이며, 이를 위해선 24GB 통합 메모리 Mac이나 24GB VRAM GPU가 사실상 최소 조건입니다.
- 2-bit: 11~13GB
- 3-bit: 13~16GB
- 4-bit: 17~19GB
- 6-bit: 24GB
- 8-bit: 31GB
- BF16: 56GB
극단적으로 줄이면 IQ2_XXS가 약 9GB에서 원본 대비 82.5% 정확도를 유지한다고 Unsloth가 측정했지만, 품질을 우선한다면 4-bit 이상이 안정적인 선택지입니다.
2. 실행 경로 — GGUF vs NVFP4
모델을 로컬에서 굴리는 방법은 크게 세 가지입니다.
- Unsloth Desktop: macOS/Windows/Linux에서 모델 검색/다운로드/실행을 GUI로 처리. RAM 오프로딩과 멀티 GPU를 자동 처리해 입문자에게 가장 쉬움
- llama.cpp + GGUF: 기존 GPU에서 가장 호환성이 높음. NVFP4를 지원하지 않는 세대(Ada/이전)에서는 사실상 표준
- NVIDIA Blackwell GPU + NVFP4: RTX 50 시리즈에서는 NVFP4가 BF16 대비 약 1.5배 빠르며 24GB VRAM에서 실행 가능
빠른 시작 — 터미널에서 30초 셋업
# Qwen3.8-27B GGUF 다운로드 (4-bit, Q4_K_M)
cd ~/models
wget https://huggingface.co/unsloth/Qwen3.8-27B-GGUF/resolve/main/Qwen3.8-27B-Q4_K_M.gguf
# llama.cpp로 로컬 서버 실행
./llama-server \
-m ~/models/Qwen3.8-27B-Q4_K_M.gguf \
-c 32768 \
--reasoning-budget high \
--host 127.0.0.1 --port 8080
# 24GB Mac(M4 Max) 기준 약 19~22 tok/s, Blackwell RTX 5090 기준 ~80 tok/s
3. 컨텍스트·기능: 256K 기본, 1M까지 확장
Qwen3.8-27B는 기본 컨텍스트가 256K이며, YaRN을 적용하면 1M 토큰까지 확장 가능합니다. 비전·추론을 모두 지원하면서 reasoning_effort를 xhigh / medium / low로 조절해 추론 깊이와 비용을 선택할 수 있다는 점이 27B 구간에서 희소한 강점입니다. 또한 이전 대화의 thinking trace를 유지하는 Preserve Thinking, MTP 기반 빠른 추론, 개선된 도구 호출 파싱이 함께 제공됩니다.

4. 코딩 벤치마크 — Qwen3.6-27B 대비 의미 있는 상승
Unsloth 측정에 따르면 Qwen3.6-27B 대비 다음과 같이 개선됐습니다.
- Terminal Bench 2.1: 63.4 → 73.0
- SWE-bench Pro: 53.5 → 61.7
- LiveCodeBench v6: 83.9 → 90.3
- CoWorkBench (장시간 업무): 61.0 → 70.7
5. Qwen3.8 라인업에서 27B의 위치
앞서 공개된 Qwen3.8-2.4T-A95B는 1-bit로 줄여도 397GB가 필요했습니다. 즉 최고 성능의 Qwen3.8 자체 호스팅이 목적이라면 2.4T가 대상이지만, Mac/PC에서 코딩·비전·에이전트용 로컬 모델을 실제로 써보려면 27B가 훨씬 현실적입니다. 4-bit 기준 17~19GB 라는 메모리 맵은 24GB 단일 머신으로 운영 가능한 첫 Qwen3.8 라인업이라는 점에서 개인 로컬 LLM의 새 기준이 됩니다.
요약
- Qwen3.8-27B는 256K 컨텍스트 + 비전 + 추론을 지원하는 27B 밀집형 멀티모달 모델
- 4-bit 양자화 시 17~19GB로 24GB Mac/RTX 5090에서 실행 가능
- Unsloth Desktop, llama.cpp GGUF, Blackwell NVFP4 세 경로 모두 지원
- 코딩 벤치 4종 모두 Qwen3.6-27B 대비 5~10점 상승
- 2.4T 라인업이 아니라 로컬에서 바로 굴릴 수 있는 Qwen3.8이라는 점이 이번 발표의 핵심
참고: 본문은 GeekNews 토픽 https://news.hada.io/topic?id=32514 의 요약을 기반으로 작성되었습니다.
📰 원본 출처 · https://news.hada.io/topic?id=32514 (#N=32514)
이 글은 GeekNews(긱뉴스)에 게제된 글을 기반으로 작성되었습니다. 원본의 라이선스와 저작권은 원작자에게 있습니다.
'AI 뉴스' 카테고리의 다른 글
| Going Dark와 법 집행기관 해킹의 시대 — 암호화 전쟁과 법 집행의 새로운 균형점 (0) | 2026.08.15 |
|---|---|
| Suno Studio 2.0 - MIDI와 AI Chat을 결합한 본격적인 음악 제작 도구 (0) | 2026.08.15 |
| 하나의 프롬프트를 11개 AI 모델에 실행했더니 나온 서로 다른 결과 — 단일 커피숍 사이트로 본 모델별 디자인 편차 (0) | 2026.08.15 |
| Count Binface, Clacton 보궐선거에서 4분의 1 넘게 득표 (0) | 2026.08.15 |
| Qwen3.8-27B 오픈 가중치 공개 — 270억 매개변수 네이티브 멀티모달, 로컬 경량 앱 개발의 새 기준 (0) | 2026.08.15 |