GLM 5.2 vs Opus — 원샷 WebGL 게임 빌드로 드러난 두 모델의 진짜 차이
같은 원샷 프롬프트 하나로 raw WebGL 3D 플랫폼 게임을 만들게 했을 때, Opus는 더 빠르고 완성도 높은 결과를 냈고 GLM-5.2는 낮은 비용과 오픈 가중치라는 장점을 보였다. 2026년 6월 현재 Z.ai의 최신 플래그십 오픈 가중치 모델 GLM-5.2와 Anthropic의 Claude Opus 4.8이 같은 실전 과제에서 갈라지는 지점을 정리한다.

테스트가 실제로 측정한 것
두 모델은 동일한 원샷 프롬프트, 동일한 Kenney Platformer Kit CC0 에셋, 힌트 없는 단일 시도를 받았다. 게임 엔진이나 Three.js 같은 3D 렌더링 라이브러리 없이 브라우저용 3D 플랫폼 게임을 raw WebGL로 처음부터 만들라는 과제였다. 완성 조건은 GLB 바이너리 파서, 행렬·쿼터니언 수학, WebGL2 렌더러, GLSL 스키닝 셰이더, 서브스텝 AABB 충돌을 상당 부분 직접 구현하는 것이었다.
두 모델 모두 GLB 파서, 행렬·벡터 수학, WebGL2 렌더러, GLSL 스키닝 셰이더, 서브스텝 AABB 충돌을 직접 구현했다. 빌드 기록과 두 게임의 소스는 모두 공개되어 있다.
GLM-5.2의 성격과 한계
GLM-5.2는 Z.ai의 최신 플래그십 모델이며, MIT 라이선스 오픈 가중치로 제공된다. Hugging Face와 ModelScope에 가중치가 올라와 있고 vLLM, SGLang, Transformers로 로컬 서빙이 가능하다. 1M 토큰 컨텍스트 창을 제공하며 사고 수준은 High와 Max가 있다(테스트에서는 High 사용).
결정적인 제약은 텍스트 전용이라는 점이다. GLM-5.2는 이미지를 읽을 수 없다. 스크린샷이나 다이어그램을 직접 확인해야 하는 워크플로에는 멀티모달 모델이 필요하다.
가격과 실행 비용
벤더 문서 기준 1M 토큰당 가격은 GLM-5.2가 Opus보다 낮다.
| 모델 | 입력 | 캐시 읽기 | 출력 |
|------|------|-----------|------|
| Claude Opus 4.8 | $5 | $0.50 | $25 |
| GLM-5.2 | $1.4 | $0.26 | $4.4 |
출력 토큰 기준으로 GLM-5.2는 Opus 가격의 5분의 1 미만이다. 실제 게임 제작 테스트에서는 시간과 비용이 반대로 갔다.
| 지표 | GLM-5.2 (Pi/OpenRouter) | Opus (Claude Code) |
|------|--------------------------|---------------------|
| 빌드 시간 | 1시간 10분 40초 | 33분 30초 |
| 출력 토큰 | 131,000 | 216,809 |
| 최대 컨텍스트 사용량 | 1M의 16% | 1M의 19% |
| 도구 호출 | 128 | 153 |
| 비용 | $5.39 | 약 $21.92 |
Opus는 약 절반의 시간에 작업을 끝냈고, GLM-5.2는 4분의 1 수준의 비용으로 작업을 마쳤다.
플레이 결과와 남은 버그
두 게임 모두 WASD/방향키 이동, Space 점프, Shift 달리기, 마우스 드래그 카메라 회전, 휠 줌을 지원하며 코인 수집, 스파이크 회피, 깃발 도달 목표를 가졌다.
GLM-5.2 결과는 전반적으로 거친 완성도를 보였다. 캐릭터 일부 머티리얼이 빠지고, 이동 방향과 반대로 돌아선 채 걷는 문제가 있었다. 스파이크 함정이 캐릭터를 리셋시키지 않았고 깃발에 도달해도 승리 조건이 발동하지 않았다. 카메라가 움직일 때 머리가 사라졌고 디버그 오버레이가 남아 있었다. 다만 스프링을 밟으면 다음 플랫폼까지 튀어 오르는 부분은 잘 동작했다.
Opus 결과는 더 깨끗하고 잘 동작했다. 카메라와 컨트롤러가 작동했고 스파이크가 플레이어를 죽이는 로직도 동작했다. 텍스처가 제대로 적용되고 애니메이션이 부드러웠으며 깃발 도달 시 승리가 가능했다. 남은 버그는 coyote-time 유예 시간이 과해 공중 발판 판정이 느슨한 점, 깃발에서 멀리 떨어져 있어도 승리 조건이 발동하는 점 같은 엣지 케이스였다.
자기 검증에서 갈린 멀티모달 차이
두 모델 모두 작업을 끝내기 전 결과 검증 지시를 받았다. Opus는 멀티모달 모델이라 게임을 렌더링한 뒤 캡처된 스크린샷을 직접 검사했다. 디버그 표시가 남아 있던 화면을 보고 제거한 뒤 마무리했다. 최종 장면에서 블록, 계단, 코인, 보석, 스파이크, 깃발, 캐릭터, 점수 HUD, 조명과 지오메트리를 확인했다.

GLM-5.2는 이미지를 읽을 수 없어 우회했다. 원시 픽셀 데이터를 읽고 색상이 기대값과 대략 맞는지 확인하는 grass green, dirt brown, coin gold, flag red, character bluish 같은 색상 조건 스크립트를 작성했다. 이 방식은 실제 화면의 문제를 놓쳤다. 캐릭터가 회색으로 보이고 텍스처가 누락된 상태였음에도 통과시켰다. 시각적 결과물이 중요한 작업에서는 멀티모달 검증이 실제 품질 차이로 이어진다.
벤치마크에서 보인 위치
Z.ai 모델 카드의 주요 수치를 Opus 4.8과 비교하면 다음과 같다.
| 벤치마크 | GLM-5.2 | Opus 4.8 |
|----------|---------|----------|
| HLE | 40.5 | 49.8 |
| HLE with tools | 54.7 | 57.9 |
| AIME 2026 | 99.2 | 95.7 |
| IMOAnswerBench | 91.0 | 83.5 |
| SWE-bench Pro | 62.1 | 69.2 |
| NL2Repo | 48.9 | 69.7 |
| ProgramBench | 63.7 | 71.9 |
| SWE-Marathon | 13.0 | 26.0 |
| MCP-Atlas public | 76.8 | 77.8 |
| Tool-Decathlon | 48.2 | 59.9 |
GLM-5.2는 추론 벤치마크(AIME, IMOAnswerBench)에서 앞서지만 코딩·에이전트 작업(SWE-bench Pro, NL2Repo, Tool-Decathlon)에서는 Opus가 앞선다. Artificial Analysis의 Intelligence Index v4.1에서도 GLM-5.2는 51점으로 선두 오픈 가중치 모델로 평가된다.
어떤 모델을 선택할지
GLM-5.2는 Opus 가격의 일부로 강한 성능을 내는 오픈 가중치 모델이다. 비용과 개방성이 중요하고 작업이 주로 텍스트와 논리 중심일 때 적합하다. 다운로드 가능한 가중치는 폐쇄형 모델처럼 갑자기 은퇴하거나 제한될 수 없다.
Opus는 테스트에서 더 빠르고 더 깨끗하며 더 정확한 결과물을 냈다. 시각적 결과물을 직접 보고 검증할 수 있다. 정확성, 폴리시, 시각적 판단이 중요하고 비용을 감수할 수 있는 작업에 더 적합하다.
GLM-5.2는 Opus를 대체할 주력 모델이라기보다, 저렴하고 항상 접근 가능한 강력한 보조 모델에 가깝다. 2026년 6월 기준으로 두 모델을 함께 쓰는 통합 구독 플랜이 가장 현실적인 운영 패턴이며, 코딩 작업의 약 70%는 Opus로, 나머지 30%는 GLM-5.2로 분리하는 구성이 비용과 품질 균형 면에서 합리적이다.
자주 묻는 질문
GLM-5.2가 Opus보다 추론 벤치마크에서 점수가 높은데도 코딩에서 진 이유는 무엇인가?
추론 벤치마크는 단일 정답을 맞히는 능력이고, 코딩·에이전트 작업은 다단계 도구 호출과 자기 수정 능력이 핵심이다. Opus는 작업 도중 모델 자체의 추론 강도를 조절하고 실행 환경 개선으로 사용자 입력 없이도 실수를 스스로 고치는 패턴이 잘 작동한다. GLM-5.2는 같은 비용 대비 더 많은 토큰을 쓰는 편이고 도구 호출 자체는 단순하지만 그 횟수가 적어 다단계 작업에서 완성도가 떨어진다.
GLM-5.2를 로컬에서 직접 실행할 수 있는가?
가능하다. MIT 라이선스 오픈 가중치라 Hugging Face와 ModelScope에서 가중치를 내려받아 vLLM, SGLang, Transformers로 로컬 서빙할 수 있다. 다만 텍스트 전용이라는 점은 로컬 실행에서도 동일하게 적용된다. 이미지를 봐야 하는 검증 단계가 있는 작업은 별도의 시각 모델을 호출하거나 Opus 같은 멀티모달 모델에 스크린샷을 전달하는 식의 보조 구성으로 보완하는 패턴이 HN 반응에서 자주 등장한다.
요약
GLM-5.2는 2026년 6월 현재 가장 강력한 텍스트 전용 오픈 가중치 LLM이다. 가격은 Opus의 5분의 1 미만, AIME 2026 99.2점, IMOAnswerBench 91.0점으로 추론에서는 Opus를 앞서지만 코딩·에이전트·멀티모달 검증에서는 Opus 4.8이 전반적으로 우위다. 원샷 WebGL 게임 빌드 테스트에서 Opus는 33분 30초와 $21.92로 더 깨끗한 결과물을, GLM-5.2는 1시간 10분 40초와 $5.39로 거친 결과물을 냈다. 시각적 판단이 필요 없는 텍스트·논리 중심 작업이면 GLM-5.2로 비용을 크게 낮출 수 있고, 시각 검증이 필수인 작업이면 Opus가 여전히 정답이다.
'AI 뉴스' 카테고리의 다른 글
| postmarketOS v26.06 Alpen Avocado 출시 — 모바일 리눅스 메인라인 진영의 새 이정표 (0) | 2026.06.24 |
|---|---|
| 오픈 모델로 갈아타는 데 따른 단점은 크지 않음 — 실무자가 평가하는 전환 비용의 실제 (0) | 2026.06.23 |
| Agent-Blackbox - 코딩 에이전트의 블랙박스를 열어 토큰 낭비를 줄이다 (1) | 2026.06.23 |
| Show GN: ax-grep, 에이전트 웹 검색 토큰 사용량을 3배 개선해주는 리서치 툴 (0) | 2026.06.23 |
| 에이전틱 테스팅으로 본 E2E 테스트의 다음 단계 — Slack 200건 실험 분석 (0) | 2026.06.23 |