GLM-5.2를 로컬에서 실행하는 방법 — 744B 모델을 개인 하드웨어로 끌어내리는 8가지 전략
2026년 6월 현재, 중국 Z.ai가 공개한 GLM-5.2는 744B 파라미터에 40B 활성 파라미터, 1M 컨텍스트 윈도우를 갖춘 오픈소스 모델이다. 롱 호라이즌 코딩·추론·에이전트 작업에서 Claude Opus 4.8, GPT-5.5, Gemini 3.1 Pro와 대등한 벤치마크를 찍었다. 풀 모델은 1.5TB에 달하지만 Unsloth Dynamic GGUF가 1-bit(223GB)부터 8-bit(810GB)까지 양자화 변형을 제공해서, 256GB 통합 메모리 Mac에서도 2-bit 모델을 띄울 수 있다. 이 글은 GLM-5.2를 로컬에서 실제로 돌리기 위한 양자화 선택, 하드웨어 매칭, Unsloth Studio·llama.cpp 두 실행 경로, KV cache 절약, 권장 파라미터까지 8개 섹션으로 정리한다.

1. GLM-5.2 모델 개요
GLM-5.2는 Z.ai가 공개한 최신 오픈 모델로, 한 번에 여러 단계를 거치는 코딩 작업, 추론, 에이전트 시나리오 전반에서 SOTA 성능을 낸다. 744B 총 파라미터 중 매 토큰 40B만 활성화하는 MoE 구조이고, 컨텍스트 윈도우는 1,048,576 토큰으로 1M에 근접한다. Z.ai가 Unsloth에 day-zero 액세스를 제공해 양자화·튜닝이 모델 공개와 동시에 진행된 점이 일반 오픈 모델과 다른 강점이다. Artificial Analysis 및 다수 벤치마크에서 Claude Opus 4.8, GPT-5.5, Gemini 3.1 Pro와 대등하거나 일부 구간에서 우위를 기록했다.
2. 양자화 스펙트럼과 "76% 정확도"의 의미
| 양자화 | 디스크 크기 | top-1 정확도 | 풀 모델 대비 축소율 |
|--------|-------------|---------------|---------------------|
| 1-bit (UD-IQ1_S) | 223GB | 약 76.2% | 약 86% 작아짐 |
| 2-bit (UD-IQ2_M) | 239GB | 약 82.0% | 약 84% 작아짐 |
| 3-bit | 290~360GB | — | — |
| 4-bit (UD-Q4_K_XL) | 372~475GB | 무손실 | — |
| 5-bit (UD-Q5_K_XL) | 570GB | 무손실 | — |
| 8-bit | 810GB | 무손실 | — |
| 풀 BF16 | 약 1.5TB | 100% | — |
76%라는 수치는 "프랑스 수도는?"이라는 질문에서 Paris를 76%, Sydney를 24% 고르는 의미가 아니다. 76%는 코퍼스 전반의 필러·정 stop 토큰 분포를 포함한 top-1 매칭률이다. 실제 의미는 24%의 확률로 의미 없는 토큰이 선택될 수 있다는 뜻이지, 정답을 24% 확률로 오답으로 바꾸는 것과는 다르다. 2-bit 양자화는 풀 모델 대비 약 18% 정도만 정확도가 떨어지므로, 256GB 통합 메모리 Mac에 UD-IQ2_M이 그대로 들어가는 구성은 풀 모델과 거의 동등한 활용성을 제공한다.
3. 하드웨어 요구사항 — 비트별 메모리 매칭
GLM-5.2는 총 가용 메모리(RAM + VRAM 또는 통합 메모리)가 양자화 모델 파일 크기를 여유 있게 초과해야 한다. 1-bit 223GB, 2-bit 245GB, 3-bit 290~360GB, 4-bit 372~475GB, 5-bit 570GB, 8-bit 810GB 순으로 요구량이 증가한다. Z.ai 공식 가이드 기준으로 2-bit UD-IQ2_M은 239GB 디스크를 차지하고, 256GB 통합 메모리 Mac에 직접 탑재할 수 있다. 1x24GB GPU + 256GB RAM 구성에서도 MoE 오프로딩으로 동작한다. 최적 성능을 내려면 VRAM과 시스템 RAM을 합친 총 가용 메모리가 양자화 파일 크기보다 1.5배 이상은 되어야 한다.
4. 권장 설정과 thinking 모드
GLM-5.2는 Non-thinking, Thinking High, Thinking Max 세 모드를 지원한다. 복잡한 작업에는 Thinking Max를 권장하고, 대부분의 일반 작업은 기본값인 temperature 1.0, top_p 0.95로 충분하다. SWE-Bench Pro처럼 정밀 평가가 필요한 작업만 temperature 1.0, top_p 1.0으로 올려 쓴다. thinking을 끄려면 llama.cpp에서 --chat-template-kwargs '{"enable_thinking":false}' 또는 --reasoning off로 제어한다. reasoning_effort는 "high", "max", 또는 비활성화 중에서 선택한다.
# 권장 llama.cpp 기본 실행 예시 (2-bit)
llama-cli -m GLM-5.2-UD-IQ2_M.gguf \
-c 32768 \
--temp 1.0 --top-p 0.95 \
--reasoning on \
--cache-type-k q4_1 --cache-type-v q4_1
5. KV Cache 양자화로 롱 컨텍스트 확보
GLM-5.2의 1M 컨텍스트를 그대로 쓰면 KV cache 메모리가 폭발한다. llama.cpp는 KV cache 양자화를 지원해서 q4_0을 적용하면 약 4.5 bits/weight로 약 3.5배 긴 컨텍스트(10K → 35K)를 확보할 수 있다. q4_1은 shifting 파라미터가 있어서 5 bits/weight로 약 3.2배 확장되며 q4_0보다 약간 더 정밀하다. 적용 형태는 --cache-type-k q4_1 --cache-type-v q4_1이다. 지원 dtype은 f32, f16, bf16, q8_0, q4_0, q4_1, iq4_nl, q5_0, q5_1이고 기본값은 f16이다.
6. Unsloth Studio 실행 경로
Unsloth Studio는 로컬 AI용 오픈소스 웹 UI로, 자동 RAM 오프로딩과 멀티GPU 자동 감지를 제공한다. macOS, Windows, Linux 모두 지원한다. 주요 기능은 GGUF·safetensor 모델 검색·다운로드·실행, Self-healing 툴 콜링과 웹 검색, Python·Bash 코드 실행, 추론 파라미터 자동 튜닝, llama.cpp 기반 빠른 CPU + GPU 추론이다. LLM을 2배 빠르게, VRAM을 70% 절감하면서 학습까지 수행한다.
# Unsloth Studio 설치 및 실행
pip install unsloth-studio
unsloth studio -H 0.0.0.0 -p 8888
# 브라우저에서 http://127.0.0.1:8888 접속
# HTTPS 보안 실행 (Cloudflare 터널)
unsloth studio --secure

첫 실행 시 계정 보안을 위한 비밀번호 생성 절차가 자동으로 진행된다.
7. llama.cpp 실행 경로
llama.cpp 경로는 ollama run처럼 모델 로드·다운로드를 직접 수행한다. 다운로드 속도가 느릴 수 있어서 huggingface_hub를 통한 수동 다운로드가 더 빠를 때가 많다. 2-bit는 UD-IQ2_M, 1-bit는 UD-IQ1_S 파일을 받는다. GPU를 쓰지 않거나 CPU 추론만 쓸 때는 빌드 옵션의 -DGGML_CUDA=ON을 -DGGML_CUDA=OFF로 바꾸고, Apple Mac·Metal은 OFF로 두면 Metal이 기본 지원된다. KLD(KL Divergence) 벤치마크 결과로 보면 Dynamic 4-bit UD-Q4_K_XL과 5-bit UD-Q5_K_XL은 거의 무손실이고, 작은 양자화도 중요 레이어만 높은 정밀도로 남기면 잘 동작한다. 1-bit GLM-5.2도 Flappy Bird 게임 생성 데모처럼 짧은 작업에서 정상 동작이 확인됐다.
8. 벤치마크와 실제 사례
| 벤치마크 | GLM-5.2 | Claude Opus 4.8 | GPT-5.5 | Gemini 3.1 Pro |
|----------|---------|------------------|---------|-----------------|
| AIME 2026 (Reasoning) | 99.2 | — | — | — |
| IMOAnswerBench | 91.0 | 83.5 | — | — |
| HLE | 40.5 | — | — | — |
| GPQA-Diamond | 91.2 | — | — | — |
| HMMT Feb. 2026 | 92.5 | — | — | — |
| SWE-bench Pro (Coding) | 62.1 | — | — | — |
| Terminal Bench 2.1 | 82.7 | — | — | — |
| NL2Repo | 48.9 | — | — | — |
| DeepSWE | 46.2 | — | — | — |
| ProgramBench | 63.7 | — | — | — |
| FrontierSWE (Dominance) | 74.4 | — | — | — |
| MCP-Atlas (Agentic) | 76.8 | — | — | — |
| Tool-Decathlon (Agentic) | 48.2 | — | — | — |
Hacker News 의견에서 한 사용자는 Q4_K_XL을 RAM 512GB + RTX 3090 2장 + 32코어 EPYC에서 돌려 약 6 tok/s를 기록했고, DDR4 3200MHz로 업그레이드하면 9 tok/s, 64코어로 확장하면 11 tok/s까지 가능하다는 보고를 올렸다. 하드웨어 조립 비용은 약 2,400달러였고, 하루 약 14kWh(600W 부하 × 24시간)로 전기 운영비만 연간 약 1,000달러가 든다. 다른 사용자는 RTX 3090 24GB + 192GB RAM으로 MoE 오프로딩을 시도했고, llama.cpp 구현이 DSA 희소 어텐션을 아직 지원하지 않아 학습과 다른 메커니즘으로 동작한다는 단점도 함께 보고됐다. 2-bit 양자화는 코딩 작업에 충분하지 않을 수 있고, 코딩에는 적어도 Q8 이상이 권장된다.
요약
GLM-5.2를 로컬에서 실행하는 핵심은 양자화 단계와 메모리 매칭이다. 256GB 통합 메모리 Mac은 UD-IQ2_M 2-bit로 Claude Opus급 추론을 얻을 수 있는 가장 진입 장벽이 낮은 구성이고, 512GB RAM + RTX 3090 2장은 Q4_K_XL 무손실 4-bit로 6~11 tok/s를 낸다. KV cache는 q4_1로 양자화해서 컨텍스트 3배를 확보하고, thinking 모드는 작업 복잡도에 따라 Max 또는 off로 전환한다. 2026년 6월 기준으로 GLM-5.2는 풀 1.5TB 모델 대비 86% 작은 1-bit으로도 일상적인 추론을 커버할 수 있는, 현재까지 가장 강력한 오픈 모델이다.
'AI 뉴스' 카테고리의 다른 글
| VibeThinker-3B: 3B 파라미터로 Opus 4.5 추론 성능을 넘긴 소형 모델의 등장 (0) | 2026.06.25 |
|---|---|
| Mozilla의 익명 자격 증명 구상: WEI를 거부하고 분산형 신원 구조를 제안하다 (0) | 2026.06.25 |
| Claude Code의 Extended Thinking 출력은 실제 추론이 아니다 (0) | 2026.06.25 |
| 취업과 소프트웨어는 망했다 — AI가 증폭시킨 최악의 채용 시그널 (0) | 2026.06.24 |
| Show GN: gh-orbit – 여러 worktree의 PR·CI·diff를 한 터미널에서 다루는 gh 익스텐션 (0) | 2026.06.24 |