AI 뉴스

Qwen 3.8 27B 완벽 가이드 — FP8 양자화 270억 파라미터 비전-언어 모델 실전 분석

노동1호 2026. 8. 15. 23:04
Qwen 3.8 27B 완벽 가이드 — FP8 양자화 270억 파라미터 비전-언어 모델 실전 분석

Qwen3.8-27B-FP8이 270억 파라미터 밀집형 모델로 공개됐다. FP8 양자화 가중치를 기본 제공하면서도 원본과 거의 같은 성능 지표를 유지한다는 점이 핵심이다. 이미지와 영상을 동시에 이해하는 비전-언어 모델이고, 기본 262,144토큰의 문맥 길이를 YaRN으로 100만 토큰까지 확장할 수 있다.

개요 — 무엇이 달라졌나

  • Qwen3.8-27B-FP8은 이미지·영상 이해와 장기 에이전트 작업을 지원하는 270억 파라미터 밀집형 모델로, 원본과 성능 지표가 거의 같은 세밀한 FP8 양자화 가중치를 제공함
  • 기본 활성화된 사고 모드는 요청별로 끌 수 있으며, reasoning_effort로 추론 깊이를 조절하고 preserve_thinking으로 이전 대화의 추론 문맥을 유지함
  • 기본 문맥 길이는 262,144토큰이며 YaRN으로 100만 토큰까지 확장할 수 있지만, 정적 스케일링은 짧은 입력의 성능에 영향을 줄 수 있음
  • Terminal Bench 2.1 73.0, SWE-bench Pro 61.7, OSWorld-Verified 84.3, AndroidWorld 81.9 등에서 Qwen3.6-27B보다 높은 점수를 기록했지만, 일부 평가는 자체 벤치마크나 수정된 조건을 사용함
  • Hugging Face Transformers와 vLLM·SGLang·TokenSpeed를 지원하며, OpenAI 호환 Chat Completions API로 텍스트·이미지·영상을 처리할 수 있고 관리형 Qwen Cloud 서비스도 출시 예정임

모델과 FP8 배포판

Qwen 3.8 27B 모델 아키텍처

  • Qwen3.8-27B-FP8은 후처리 학습된 Qwen3.8-27B의 가중치와 설정을 Hugging Face Transformers 형식으로 제공함
  • 블록 크기 128의 세밀한 FP8 양자화를 적용했으며, 성능 지표는 원본 모델과 거의 동일함
  • Qwen3.5 아키텍처를 기반으로 코딩, 전문 업무, 연구, 장기 에이전트 작업 성능을 개선함
  • 이미지와 영상을 직접 이해하는 비전-언어 모델로, 복잡한 다단계 작업을 더 안정적으로 끝내도록 설계됨
  • Transformers, vLLM, SGLang, TokenSpeed 등과 호환됨
  • 관리형 추론 서비스 Qwen Cloud는 기본 100만 토큰 문맥과 공식 내장 도구 등 프로덕션 기능을 갖춘 호스팅 버전을 제공할 예정임

코딩·연구·에이전트 역량

  • 코딩, 전문 업무, 연구와 장기 에이전트 작업 전반을 핵심 역량으로 삼음
  • 자율 계획과 환경 피드백 처리를 강화해 종단 간 에이전트 실행의 신뢰성을 높임
  • 널리 쓰이는 에이전트 하네스와 개발 도구를 폭넓게 지원해 기존 스택에 통합하기 쉬움
  • 사고 모드는 기본 활성화되지만 요청별로 비활성화할 수 있음 reasoning_effort는 xhigh, medium, low로 추론 깊이와 비용을 조절함
  • preserve_thinking은 과거 메시지의 추론 문맥을 유지함

모델 구조와 문맥 길이

  • 비전 인코더를 결합한 인과적 언어 모델로 사전 학습과 후처리 학습을 거침
  • 언어 모델은 270억 파라미터, 은닉 차원 5,120, 64개 계층, 248,320 크기의 패딩된 토큰 임베딩과 출력을 사용함
  • 은닉 구조는 16 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN))임 Gated DeltaNet은 V용 선형 어텐션 헤드 48개와 QK용 16개, 헤드 차원 128을 사용함
  • Gated Attention은 Q 헤드 24개와 KV 헤드 4개, 헤드 차원 256, RoPE 차원 64를 사용함
  • FFN 중간 차원은 17,408임

텍스트·에이전트 벤치마크

  • Qwen3.8-27B는 Qwen3.6-27B보다 주요 코딩 벤치마크 점수가 높음 Terminal Bench 2.1은 73.0 대 63.4, SWE-bench Pro는 61.7 대 53.5임
  • NL2Repo-Bench는 42.3 대 36.2, DeepSWE 1.1은 42.2 대 13.3임
  • 자체 소프트웨어 엔지니어링 평가인 QwenSWEBench는 79.0 대 49.3임
  • 자체 평가 CoWorkBench는 70.7, JobBench는 33.4임
  • Agents’ Last Exam은 Pass@1 20.4, 점수 42.9를 기록함
  • SWE-bench Pro에서는 Opus4.6 Max만 공식 점수를 사용했고, 나머지는 Claude Code 하네스와 256K 문맥으로 재평가함
  • NL2Repo-Bench에서는 보상 해킹을 막기 위해 특정 저장소에 접근하는 pip download, pip install, git clone 명령을 차단함
  • QwenSWEBench는 자체 벤치마크이며 8시간 제한과 avg@3 조건을 사용함
  • CoWorkBench도 컴퓨터 과학·금융·법률·의료 등의 장기 업무를 평가하는 자체 벤치마크임
  • HLE 평가는 GPT-4o가 판정함

비전·멀티모달 벤치마크

  • 에이전트형 멀티모달 평가에서 OSWorld-Verified 84.3, WebArena-Verified 64.8, AndroidWorld 81.9를 기록함
  • 애플리케이션 재현과 개발 작업에서는 RecreationBench 47.1, SWE-MM 38.6, Vision2Web 62.9임
  • ClawEval-MM은 Pass@3 57.4와 3회 평균 56.9를 기록함
  • 일반 시각 지능 평가 결과는 다음과 같음 MathVision은 문맥 이미지(CI) 없이 90.0, 포함 시 94.6임
  • BabyVision은 CI 없이 65.7, 포함 시 85.6임
  • CharXiv RQ는 CI 없이 83.7, 포함 시 90.2임
  • OmniDocBench 1.5는 91.1, RealWorldQA는 85.9, ERQA는 65.5임

추론 서버와 API 사용

  • 간단한 통합에는 API가 적합하며, 프로덕션이나 고처리량 환경에는 최신 버전의 SGLang·vLLM·TokenSpeed 같은 전용 서버 엔진을 권장함
  • Transformers에서는 pipeline("image-text-to-text") 또는 AutoModelForMultimodalLM으로 불러올 수 있음
  • vLLM과 SGLang은 pip 설치 후 OpenAI 호환 API 서버로 실행할 수 있으며 Docker 배포도 지원함
  • Chat Completions API는 OpenAI Python SDK에 API 기본 URL과 키를 설정해 사용할 수 있음
  • 텍스트, image_url, video_url 입력을 지원함 vLLM의 영상 프레임 샘플링은 mm_processor_kwargs의 fps와 do_sample_frames로 조정할 수 있음
  • 이 프레임 샘플링 기능은 현재 vLLM에서만 지원됨

사고 모드와 대화 문맥

  • 기본 사고 모드는 최종 답변 전에 <think>...</think> 블록을 생성함
  • 권장 샘플링 설정은 모드에 따라 달라짐 사고 모드: temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0
  • 비사고 모드: temperature=0.7, top_p=0.80, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0
  • 지원되는 매개변수는 추론 프레임워크마다 다름
  • 에이전트의 의사결정 일관성과 문맥 연속성을 유지하고 중복 추론을 줄이며 KV 캐시 활용을 개선함
  • preserve_thinking=False로 설정하면 최신 사용자 메시지의 사고 블록만 유지함

긴 출력·문맥·영상 설정

  • 에이전트 작업에는 충분한 출력 길이를 할당하는 것이 좋음 100만 토큰 문맥 안에서 내부 추론은 최대 262,144토큰, 최종 답변은 최대 131,072토큰을 권장함
  • vLLM, SGLang, TokenSpeed에서 모델 설정이나 실행 인자로 최대 100만 토큰 문맥을 구성할 수 있음
  • 4배 확장에는 factor=4.0, 일반적인 문맥이 524,288토큰이면 factor=2.0을 권장함
  • 이는 224K 영상 토큰에 해당하며 예시 shortest_edge는 4,096임
  • 엔진 시작 인자로도 기본값을 덮어쓸 수 있고, 구현 정보는 vLLM과 SGLang에서 확인할 수 있음

실전 코드 — OpenAI 호환 API로 호출하기

Qwen3.8-27B-FP8은 vLLM이나 SGLang 같은 추론 서버에 그대로 올리면 OpenAI 호환 Chat Completions API로 쓸 수 있다. reasoning_effort로 추론 깊이를, preserve_thinking으로 대화 간 추론 문맥 유지 여부를 제어한다.

from openai import OpenAI

# Qwen3.8-27B-FP8을 OpenAI 호환 Chat Completions API로 호출
client = OpenAI(
    base_url="http://localhost:8000/v1",  # vLLM/SGLang 서버
    api_key="EMPTY"
)

response = client.chat.completions.create(
    model="Qwen3.8-27B-FP8",
    messages=[{"role": "user", "content": "이미지와 영상을 동시에 이해해서 다음 작업을 도와줘"}],
    extra_body={
        "reasoning_effort": "medium",   # xhigh / medium / low
        "preserve_thinking": True,      # 이전 대화 추론 문맥 유지
    },
    max_tokens=2048,
)

print(response.choices[0].message.content)

Qwen 3.8 27B 벤치마크 결과

전망 — FP8 배포판이 표준이 될까

FP8은 RTX 4090·H100·H200 같은 소비자/데이터센터 GPU에서 메모리 절반과 비슷한 처리량을 주면서도 정확도 손실은 거의 없다. 27B 같은 중간 규모 모델이 FP8 기본 배포판을 내장 추론 서버(vLLM·SGLang·TokenSpeed)와 함께 제공하면, 로컬 LLM 운영의 진입 장벽이 크게 낮아진다. Qwen Cloud라는 관리형 서비스도 출시 예정이라, 직접 서빙이 부담스러운 팀은 API 형태로 같은 모델을 받아볼 수 있게 된다.

다만 자체 벤치마크와 수정된 평가 조건을 쓴 부분이 있다는 점, 그리고 100만 토큰 YaRN 확장이 짧은 입력에서 성능을 깎을 수 있다는 점은 도입 전에 직접 회귀 테스트로 확인해둘 필요가 있다.

요약

  • Qwen3.8-27B-FP8은 FP8 양자화를 기본 채택한 270억 파라미터 비전-언어 모델이다.
  • 262,144토큰 기본 문맥 + YaRN으로 100만 토큰 확장, reasoning_effort로 추론 깊이 조절.
  • vLLM·SGLang·TokenSpeed와 Hugging Face Transformers 호환, OpenAI 호환 Chat Completions API 제공.
  • Terminal Bench 2.1 73.0, SWE-bench Pro 61.7, OSWorld-Verified 84.3, AndroidWorld 81.9 등에서 Qwen3.6-27B 대비 우위.
  • 관리형 Qwen Cloud 서비스 출시 예정, 로컬/클라우드 양쪽 선택지 확보.

📰 원본 출처 · https://news.hada.io/topic?id=32510 (#N=32510)

이 글은 GeekNews(긱뉴스)에 게제된 글을 기반으로 작성되었습니다. 원본의 라이선스와 저작권은 원작자에게 있습니다.