AI 뉴스

Gemma 4 12B: 통합형 인코더 없는 멀티모달 모델 완벽 가이드

노동1호 2026. 6. 4. 23:03

Gemma 4 12B: 통합형 인코더 없는 멀티모달 모델 완벽 가이드

Gemma 4 12B: 통합형 인코더 없는 멀티모달 모델 완벽 가이드

2026년 5월, Google이 Gemma 4 계열에 새로운 중간 크기 모델 Gemma 4 12B를 공개했습니다. 노트북 한 대로 에이전트형 멀티모달 AI를 실행할 수 있도록 설계된 이 모델은, 별도의 비전·오디오 인코더 없이 LLM 백본이 직접 입력을 처리하는 인코더 없는 통합 아키텍처를 도입해 화제입니다. 16GB 메모리만으로 로컬 실행이 가능하다는 점, Apache 2.0 라이선스, 그리고 표준 벤치마크에서 26B MoE 모델에 근접한 성능까지 — 온디바이스 AI의 새로운 기준이 될 가능성이 큽니다.

인코더 없는 멀티모달이란 무엇인가

기존 멀티모달 모델은 이미지, 오디오 같은 비언어 입력을 먼저 전용 인코더(SigLIP, CLAP 등)로 임베딩한 다음, 그 표현을 LLM에 전달하는 2단계 구조를 사용했습니다. 인코더가 입력의 의미를 압축해 해석하기 때문에 모델 자체는 단순해지지만, 인코더의 메모리 점유와 처리 지연이 따라옵니다.

Gemma 4 12B는 이 분리된 인코더를 제거했습니다. 비전 입력은 단일 행렬 곱셈 + 위치 임베딩 + 정규화로 구성된 경량 임베딩 모듈로, 오디오 입력은 원시 신호 자체가 텍스트 토큰과 같은 차원으로 투영됩니다. 비전 인코더 모듈은 약 35M 파라미터로 줄어들어 LLM 백본이 시각 정보를 직접 다루는 형태입니다.

개발자 가이드에서는 이를 초기 융합(early fusion) 아키텍처로 설명합니다. FAIR가 2년 전 Chameleon에서 이미 시도한 접근이지만, 당시에는 멀티모달 출력까지 가능했던 것과 달리 Gemma 4 12B는 입력만 지원합니다. 입력과 출력을 모두 통합한 멀티모달로 확장할 수 있을지는 향후 모델 라인업의 과제입니다.

라인업 내 위치: E4B와 26B MoE 사이

Gemma 4 시리즈는 현재 3개 트랙으로 나뉩니다.

E4B: 모바일·엣지 디바이스 우선의 초경량 모델

12B(이번 발표): 노트북·데스크톱 타깃 중간 크기 모델

26B MoE: 더 큰 추론 능력이 필요한 고성능 트랙

12B는 edge 친화적인 E4B와 고급 26B 사이의 간극을 메우는 것이 명시적 목표로, 26B에 가까운 표준 벤치마크 점수를 절반 미만의 메모리 풋프린트로 달성합니다. Gemma 4 라인업 전체의 누적 다운로드는 1억 5천만 회를 돌파했고, 12B는 그 생태계에 자연스럽게 합류합니다.

로컬 실행 환경과 실용성

모델이 실제로 의미 있으려면 내 머신에서 돌아야 합니다. Gemma 4 12B의 요구 사항은 다음과 같습니다.

• 8비트 양자화 시 약 12GB, 4비트 GGUF 시 약 6GB

• 16GB 통합 메모리 Mac, 또는 12~16GB VRAM 소비자용 GPU에서 실행 가능

• 4비트 GGUF 기준 12GB VRAM 카드에서 출력 약 5토큰/초(하드웨어 가속 여부에 따라 변동)

Hacker News 사용자 테스트에 따르면 4비트 Q4 양자화로 Minesweeper 바이브 코딩 벤치마크를 돌렸을 때, 출력 품질은 14개월 전 출시된 GPT-4.1과 대등한 수준이었고 코딩 모델은 아니지만 대화형 작업에는 충분히 쓸만했습니다. 다만 12GB VRAM 카드의 5토큰/초는 CPU와 시스템 RAM이 혼합된 하이브리드 모드 결과이므로, RTX 2080/3060 같은 소비자 GPU에서 llama.cpp CUDA 백엔드를 쓴다면 20토큰/초 이상도 기대할 수 있습니다.

다만 비전 작업은 여전히 약점입니다. "This is a test"라고 적힌 단순 이미지를 주고 6분 분석 후 실패한 사례가 보고된 반면, Qwen 3.5 0.8B는 1초도 안 되게 정답을 맞혔습니다. Google의 강화된 가드레일이 작은 모델의 비전 추론을 일부 방해하는 것으로 보입니다.

Multi-Token Prediction과 지연 시간

Gemma 4 12B는 Multi-Token Prediction(MTP) drafters를 통해 토큰 생성 속도를 높입니다. 한 번에 다음 토큰 하나만 예측하는 대신, 초안이 될 가능성이 높은 여러 토큰을 미리 생성한 뒤 본 모델이 검증하는 speculative decoding 계열의 접근입니다.

MTP는 Qwen 3.6 같은 다른 소형 모델에서도 효과가 검증된 기법으로, LM Studio 같은 데스크톱 도구에서 체감할 수 있는 응답성을 끌어올립니다. 다만 Google AI Edge Gallery App이 MTP drafter를 실제로 활용하는지는 공식 문서에서 명확히 확인되지 않습니다.

시작하기: 설치 경로

Gemma 4 12B는 다양한 진입 경로를 제공합니다.

클릭 한 번 실행: LM Studio, Ollama, Google AI Edge Gallery App, Google AI Edge Eloquent 앱, LiteRT-LM CLI

체크포인트 다운로드: Hugging Face, Kaggle (사전학습 + instruction-tuned 버전 제공)

로컬 추론 통합: Hugging Face Transformers, llama.cpp, MLX, SGLang, vLLM

파인튜닝: Unsloth

프로덕션 배포: Google Cloud (Gemini Enterprise Agent Platform Model Garden, Cloud Run, GKE)

개발자용 통합 가이드와 quick start 노트북이 공식 문서로 제공되므로, 로컬 멀티모달 에이전트를 처음 구성하는 경우에도 진입 장벽이 낮습니다.

Gemma 4 12B: 통합형 인코더 없는 멀티모달 모델 완벽 가이드

Google이 12B를 공개하는 전략적 의미

단순한 호의나 마케팅이 아닐 가능성이 높습니다. 프런티어 추론 모델에서 업계 평균 총마진이 약 80%에 달하는데, 이는 희소 자원인 프런티어 모델을 통제해 누리는 프리미엄입니다. Google은 프런티어 추론은 유료로 유지하면서, 그 아래 단계 모델은 Apache 2.0으로 풀어 모델 자체를 상품화하는 전략을 취하고 있습니다.

결과적으로:

1. 작은 로컬 모델로 시작해 익숙해진 개발자와 기업이, 더 무거운 작업에서 결국 유료 프런티어 추론으로 업그레이드하는 경로가 만들어집니다.

2. Android, Chrome 같은 Google 플랫폼 제품군에는 온디바이스 AI 기능이 필수인데, 어차피 누군가 가중치를 추출할 것이므로 공식 오픈소스화가 역설적으로 더 유리합니다.

3. 경쟁사가 프런티어 모델 유지에 더 많은 비용을 쓰도록 만드는 간접적 가격 압박이 발생합니다.

코딩 모델로 쓸 수 있을까

Hacker News의 직접 벤치마크 결과를 종합하면:

측면평가
Minesweeper 코딩 (Q4 GGUF)괜찮음 — GPT-4.1과 대등
일반 코딩 (다른 12B급 대비)다소 낮음 — Qwen 3.6 35B A3B, Gemma 4 26B A4B에 뒤짐
추론 능력강점 — 작은 모델이 1년 전 프런티어급 추론을 따라잡음
문법 정확도드물게 괄호 누락, 함수 정의를 쉼표로 끊는 등의 사소한 오류

코딩 전용으로 학습된 모델은 아니므로, 16GB 노트북 환경에서 코드 생성이 1순위 목적이라면 Qwen 3.5 9B가 더 검증된 선택입니다. 다만 오디오·비전 입력을 동시에 받는 멀티모달 에이전트의 두뇌로 쓴다면 12B의 가치는 분명합니다.

전망: 온디바이스 AI의 다음 단계

Gemma 4 12B는 다음 흐름의 시작점입니다.

로컬 멀티모달 에이전트: 음성 명령과 카메라·스크린샷을 받아 추론하는 에이전트가 클라우드 없이 동작

프라이버시 우선 워크플로우: 민감한 문서·이미지를 로컬에서 처리하고 비식별화된 결과만 클라우드로 전달

개발 도구 내장: IDE, 디자인 툴, 데이터 분석 환경에 12B급 모델이 기본 내장

에너지 효율: 12B가 26B의 절반 이하 메모리로 비슷한 작업을 수행한다는 점은 모바일·배터리 환경에서 결정적

Gemma 4 12B가 벤치마크상 26B의 절반만 따라가도, 단기적으로는 소비자 대상 클라우드 사업 모델에 의문을 제기할 수 있는 임계점을 넘었다고 볼 수 있습니다. Google이 Android, Chrome, TPU, Cloud를 동시에 보유한 수직 통합 플레이어라는 점을 고려하면, 12B 공개는 단순한 모델 릴리스가 아니라 로컬 우선 AI 시대를 향한 Google의 전략적 포석으로 읽힙니다.

요약

Gemma 4 12B는 노트북에서 에이전트형 멀티모달 AI를 실행하기 위한 중간 크기 모델

인코더 없는 통합 아키텍처로 비전·오디오 입력을 LLM 백본이 직접 처리

• 16GB 메모리 노트북에서 로컬 실행 가능, 4비트 GGUF 기준 약 6GB VRAM

• Apache 2.0 라이선스, Hugging Face·Kaggle에서 다운로드 가능

• MTP drafters로 지연 시간 감소, 표준 벤치마크에서 26B MoE에 근접

• 비전 작업은 여전히 Qwen 계열에 비해 약점, 코딩 능력은 준수하지만 전용 모델보다 낮음

• Google의 프런티어와 오픈소스 이중 전략의 일환으로 로컬 우선 AI 생태계 확장이 목적


📚 출처

https://news.hada.io/topic?id=30151