AI 뉴스

Gemma 4 QAT 모델: 모바일과 노트북에서 LLM을 돌리는 새로운 기준

노동1호 2026. 6. 6. 23:07

Gemma 4 QAT: 모바일과 노트북에서 LLM을 돌리다


Gemma 4 QAT 모델: 모바일과 노트북에서 LLM을 돌리는 새로운 기준

최근 Google이 공개한 Gemma 4 QAT 체크포인트는 온디바이스 AI의 판도를 바꿀 만한 기술적 진전이다. 양자화 인식 학습(Quantization-Aware Training, QAT)을 적용해 모델 크기를 대폭 줄이면서도 정확도 손실을 최소화했기 때문이다. 12B 모델이 8GB VRAM에서 돌아가고, E2B 텍스트 전용 모델은 1GB 미만 메모리로 동작한다. 노트북 한 대로 LLM을 굴리던 시대가 본격적으로 열린 것이다.

QAT가 중요한 이유: PTQ와 무엇이 다른가

일반적으로 모델을 압축할 때는 학습 후 양자화(Post-Training Quantization, PTQ) 방식을 쓴다. 학습이 끝난 모델 가중치를 사후에 4비트, 8비트 등으로 변환하는 방식이다. 빠르고 간편하지만 정확도 손실이 불가피하다. 특히 4비트 미만의 공격적 양자화에서는 품질 저하가 두드러진다.

반면 QAT는 학습 과정 자체에 양자화를 시뮬레이션한다. 모델이 학습 단계에서부터 "내 가중치가 나중에 4비트로 잘릴 거야"라는 사실을 인지하고 적응하는 것이다. 그 결과 동일 압축률에서도 PTQ보다 높은 품질을 유지한다. Google은 Q4_0 형식에 QAT 레시피를 적용했고, 표준 PTQ 대비 전반적 품질이 우위라는 벤치마크를 제시했다.

모바일 특화 양자화 스키마의 4가지 핵심

Gemma 4 E2B/E4B 같은 에지 모델에는 모바일 칩에 맞춘 별도 양자화 스키마가 적용됐다. 단순히 비트를 자르는 것이 아니라, 모바일 하드웨어의 작동 방식을 깊이 반영한 설계다.

1. 정적 활성화(Static Activation)

데이터 스케일 설정을 학습 중에 미리 계산한다. 추론 시점에서 동적으로 보정할 필요가 없으니 모바일 칩의 연산량이 줄고 응답 속도가 빨라진다.

2. 채널별 양자화(Channel-wise Quantization)

압축 데이터를 모바일 가속기 구조에 맞춰 정렬한다. 메모리에서 읽어온 후 우회 경로로 재배치할 필요 없이 네이티브 계산이 바로 가능하다.

3. 선택적 2비트 양자화

모든 레이어를 균일하게 자르지 않는다. 토큰 생성부는 2비트로 강하게 압축하고, 추론의 정확도에 직결되는 핵심 레이어는 더 높은 정밀도를 유지한다. 저장 공간과 품질의 균형점이 된다.

4. 임베딩·KV 캐시 최적화

어휘 목록(임베딩)과 단기 메모리(KV 캐시)에 압축을 집중한다. 이 부분이 실제로 추론 시 활성 메모리를 가장 많이 잡아먹기 때문이다. 그 결과 Gemma 4 E2B 텍스트 전용 모델은 1GB 미만 메모리로 구동된다.

E2B vs E4B vs 12B: 어떤 걸 골라야 할까

Gemma 4 라인업은 용도에 따라 세 갈래로 나뉜다.

모델용도QAT 적용 시 메모리추천 사용처
E2B (텍스트 전용)모바일, 임베디드1GB 미만온디바이스 분류, 간단한 Q&A
E4B에지 디바이스약 3GB멀티모달 입력 처리, 스마트폰
12B소비자 노트북6.7GB VRAM일반 로컬 추론, RTX 5060 8GB 가능

E2B는 오디오·비전 인코더를 떼어낸 경량 버전이라 단순 텍스트 작업에서 효율이 극대화된다. E4B는 Pixel 기기에서 오디오/이미지를 실시간으로 처리할 수 있고, 12B는 노트북 한 대로 8GB VRAM 환경에서 돌아가는 게 핵심점다. Hacker News 사용자의 실제 후기에서는 AMD Ryzen 9 8940HX + RTX 5060 8GB + RAM 14GB 노트북에서 ollama로 Q4_0 12B를 돌렸을 때 "예상보다 빠르다"는 반응이 나왔다.

도구 지원: 어떤 런타임을 써야 하나

Google은 QAT 가중치를 다양한 생태계에 동시 공개했다. 환경에 맞는 도구를 고르면 된다.

로컬 추론(데스크톱): llama.cpp, Ollama, LM Studio

온디바이스 배포: Google LiteRT-LM (uvx litert-lm run으로 즉시 실행 가능)

웹 브라우저 내 실행: Transformers.js

대형 모델 서빙: SGLang, vLLM

Apple Silicon 최적화: MLX

파인튜닝: Hugging Face Transformers, Unsloth

MLX나 Unsloth 컬렉션을 활용하면 Apple Silicon과 모바일 기기에서 추가 최적화된 버전을 얻을 수 있다. Unsloth 측에서는 자체 QAT 분석을 공개하면서 Google 원본 대비 더 나은 정확도를 보였다고 주장한다. 격자 정렬 문제 등의 미세한 차이로 두 패킹 사이 변환 시 손실이 발생하기 때문이라고.

MTP QAT의 의미: 추론 가속을 양자화 속으로

이번 릴리스에는 Multi-Token Prediction(MTP) 기능이 양자화된 채로 보존된 체크포인트도 포함됐다. MTP는 한 번에 여러 토큰을 예측해 디코드 속도를 높이는 기법으로, Gemma 4 공개 직후 커뮤니티에서 큰 관심을 끌었던 부분이다. QAT로 압축해도 MTP의 속도 이점을 유지할 수 있다는 건, 양자화가 더 이상 "느린 모델"의 동의어가 아니라는 뜻이다.

실전 시작 가이드

가장 빠르게 Gemma 4 QAT를 만져보려면 다음 명령어 한 줄이면 된다.

# 모바일/에지 디바이스uvx litert-lm run gemma-4-E2B-it-litert-lm# 데스크톱(Apple Silicon)ollama run hf.co/google/gemma-4-12B-it-qat-q4_0-gguf:Q4_0# 이미지 입력 처리uvx litert-lm run gemma-4-E2B-it-litert-lm \--attachment image.jpg --prompt "이 이미지를 설명해줘"# 오디오 입력 처리uvx litert-lm run gemma-4-E2B-it-litert-lm \--attachment audio.wav --prompt "이 오디오를 텍스트로 변환해줘"

전망: 온디바이스 LLM의 본격 시대

Gemma 4 QAT의 진짜 의미는 "스펙시트가 아니라 실제 동작 환경"에서 드러난다. 한 사용자는 Pixel 폰에 내장한 2B 모델을 Unsloth Studio + API로 웹 검색과 JSON 출력에 활용하고 있다고 후기를 남겼다. 또 다른 사용자는 8GB VRAM 노트북에서 12B 모델이 돌가는 모습에 "큰 변화"라고 반응했다.

Apple이 WWDC에서 Google 모델 기반의 개선된 Siri를 시연할 예정이라는 루머가 돌고 있다. 만약 그렇다면 Gemma 4 QAT는 단순한 오픈소스 릴리스를 넘어 메인스트림 모바일 OS에 LLM을 탑재하기 위한 인프라가 되는 셈이다. Google이 이 한 주에만 12B 모델, MTP, 공식 양자화 모델을 연속으로 공개한 것도 이 흐름에 진심이라는 신호로 읽힌다.

로컬에서 LLM을 굴리는 건 더 이상 GPU 빌려 쓰기 게임이 아니다. 노트북, 심지어 스마트폰 한 대로도 충분히 실용적인 추론이 가능한 시대가 왔다. Gemma 4 QAT는 그 전환점의 첫 번째 이정표다.


핵심 요약

• QAT는 학습 중 양자화를 시뮬레이션해 PTQ보다 높은 품질을 유지한다.

• 모바일 특화 스키마로 E2B 텍스트 전용 모델은 1GB 미만 메모리로 동작한다.

• 12B Q4_0은 8GB VRAM 노트북에서 구동 가능, 6.7GB VRAM 사용.

• llama.cpp, Ollama, LiteRT-LM, MLX, vLLM 등 다양한 런타임을 공식 지원한다.

• MTP QAT로 양자화 속에서도 추론 가속이 유지된다.


📚 출처

https://news.hada.io/topic?id=30218