2026년 6월, Z.ai의 GLM-5.2가 Artificial Analysis Intelligence Index v4.1에서 51점을 기록해 오픈 가중치(open-weight) 모델 선두에 올랐습니다. 같은 지능 수준 모델 중 태스크당 비용이 가장 낮은 축에 있다는 점이 함께 부각되면서 비용 대비 성능 차트에서 Pareto frontier에 위치합니다. 모델 크기는 GLM-5.1과 동일한 744B 전체 / 40B 활성 파라미터이지만 Intelligence Index 점수는 11점이나 높습니다.
이번 글에서는 GLM-5.2의 Intelligence Index 성적, 평가별 개선 폭, GDPval-AA v2 에이전트 성능, 비용·가격·토큰 사용량, AA-Omniscience 환각 지표, 그리고 Hacker News 개발자 반응까지 한 번에 정리합니다.

Intelligence Index v4.1 오픈 가중치 성적표
Artificial Analysis Intelligence Index v4.1은 모델의 종합 지능을 한 점수로 환산하는 벤치마크입니다. GLM-5.2는 이 지수에서 51점을 받아 오픈 가중치 모델 중 1위에 등극했습니다. 주요 오픈 가중치 모델 점수는 다음과 같습니다.
오픈 가중치 Intelligence Index 비교
| 모델 | Intelligence Index v4.1 |
|---|---|
| GLM-5.2 | 51 |
| MiniMax-M3 | 44 |
| DeepSeek V4 Pro(max) | 44 |
| Kimi K2.6 | 43 |
GLM-5.2는 GLM-5.1과 같은 744B 전체 파라미터 / 40B 활성 파라미터 규모지만 점수는 11점 높습니다. 활성 파라미터 수를 유지하면서 학습·정렬·추론 효율을 끌어올린 결과로 해석됩니다.
평가별 성능 개선 — 과학적 추론이 두드러져
GLM-5.2는 GLM-5.1 대비 대부분의 평가에서 점수가 상승했습니다. 특히 과학적 추론 관련 평가의 개선 폭이 큽니다.
주요 벤치마크 개선 폭
| 벤치마크 | 개선 폭 | 수치 |
|---|---|---|
| CritPt | +16점 | 21% |
| HLE | +12점 | 40% |
| GPQA Diamond | +3점 | 89% |
| AA-LCR | +9점 | 71% |
| tau3 banking | +15점 | 27% |
| SciCode | +7점 | 50% |
| TerminalBench v2.1 | +16점 | 78% |
CritPt와 HLE에서 두 자릿수 점수 상승이 일어났고, GPQA Diamond는 이미 89% 수준까지 올라 추가 상승 폭은 작아 보입니다. 에이전트 코딩 지표인 TerminalBench v2.1에서도 78%까지 도달했습니다.
GDPval-AA v2와 실세계 에이전트 성능
GLM-5.2는 실세계 에이전트 성능 지표인 GDPval-AA v2에서 1524점을 기록했습니다. 오픈 가중치 모델 비교에서 가장 높은 점수입니다.
GDPval-AA v2 모델 비교
| 모델 | GDPval-AA v2 점수 |
|---|---|
| GLM-5.2 | 1524 |
| MiniMax-M3 | 1418 |
| DeepSeek V4 Pro(max) | 1328 |
| GPT-5.5(xhigh reasoning) | 1514 |
이 결과는 GPT-5.5(xhigh reasoning)의 1514점과 사실상 비슷한 수준입니다. GDPval-AA v2는 기존 GDPval-AA에서 평가 방식을 바꿨습니다. Elo 기준선을 인간 성능 1000으로 설정하고 frontier-model judge의 순환 패널을 도입했으며, 더 긴 에이전트 궤적을 다루기 위해 턴 제한을 100에서 250으로 상향했습니다.
비용, 가격, 토큰 사용량 — Pareto frontier에 위치
GLM-5.2는 Intelligence vs Cost per Task 차트에서 Pareto frontier에 있으며, 같은 지능 수준 모델 중 태스크당 비용이 가장 낮은 축에 속합니다. 태스크당 비용은 GLM-5.1보다 비싸지만 더 높은 Intelligence Index를 감안하면 비용 대비 위치가 유리합니다.
태스크당 비용 비교
| 모델 | 태스크당 비용 |
|---|---|
| GLM-5.2 | 약 $0.46 |
| GLM-5.1 | $0.25 |
| Kimi K2.6 | $0.31 |
| MiniMax-M3 | $0.18 |
| DeepSeek V4 Pro(max) | $0.05 |
first-party API 가격은 GLM-5.1과 같은 수준입니다. 1M 입력 토큰당 $1.4, 1M 출력 토큰당 $4.4, 1M cache hit 토큰당 $0.26입니다. Intelligence Index 태스크당 43k 출력 토큰을 사용하며, 이 중 37k는 reasoning 토큰입니다.
출력 토큰 사용량 비교
| 모델 | 태스크당 출력 토큰 |
|---|---|
| GLM-5.2 | 43k (reasoning 37k) |
| GLM-5.1 | 26k |
| MiniMax-M3 | 24k |
| Kimi K2.6 | 35k |
| DeepSeek V4 Pro(max) | 37k |
출력 토큰 사용량은 주요 오픈 가중치 모델보다 높은 편입니다. 같은 지능 수준의 오픈 가중치 모델 중 토큰 효율은 낮은 편이며, Intelligence vs Output Tokens 차트에서 가장 매력적인 사분면에는 들지 못합니다.
모델 세부 사항과 접근성 — MIT 라이선스와 1M 컨텍스트
GLM-5.2의 라이선스는 MIT입니다. 컨텍스트 윈도우는 1M 토큰으로, GLM-5.1의 200K에서 5배 확대되었습니다. Z.ai의 first-party API와 여러 third-party 제공자에서 사용할 수 있습니다.
third-party 제공자 목록
- DeepInfra
- Novita
- Nebius
- Parasail
- Siliconflow
- GMI Cloud
- Baseten
- Fireworks
다만 Hacker News 반응에 따르면 비공식 제공자는 조심해야 합니다. 모델을 잘못 설정하거나 몰래 양자화하는 경우가 많고, 한동안 공식 API의 Kimi와 대부분의 서드파티 제공자 사이에는 20~40% 차이가 있었습니다. OpenRouter에서 더 싼 상품 일부는 양자화 모델이고 양자화로 지능이 얼마나 줄어드는지는 확실치 않습니다.
AA-Omniscience와 환각 지표
GLM-5.2는 AA-Omniscience Index에서 4점을 기록해 GLM-5.1의 2점보다 높습니다. 정확도는 25.1%로 GLM-5.1의 24.2%보다 높고, hallucination rate는 28.1%로 GLM-5.1의 29.4%보다 낮습니다. attempt rate는 47%로 동일합니다.
AA-Omniscience 비교
| 지표 | GLM-5.2 | GLM-5.1 |
|---|---|---|
| Index 점수 | 4점 | 2점 |
| 정확도 | 25.1% | 24.2% |
| Hallucination rate | 28.1% | 29.4% |
| Attempt rate | 47% | 47% |
환각 비율이 약 1.3%p 낮아지고 정확도가 0.9%p 상승한 것은 같은 모델 크기에서 정렬·데이터 개선이 일어났음을 시사합니다. 모델 비교는 Artificial Analysis의 GLM-5.2 페이지에서 확인할 수 있습니다.
개발자 현장 반응 — Hacker News
Hacker News 사용자 의견에서는 추론 효율에 대한 의견이 분분합니다. LLM 평가용으로 Nim으로 간단한 수식 평가 라이브러리를 작성하게 하는 테스트에서 GLM 5.2 xhigh는 첫 파일을 쓰기 전까지 15분 넘게 추론하며 약 45k 토큰을 썼다는 반응이 있습니다. GPT 5.5 xhigh는 평균 총 16k 토큰, high는 10k, Fable 5는 33k, Opus 4.8은 41k, GLM 5.2는 42k라서 GPT 5.5의 추론 효율이 압도적으로 좋다는 평가입니다.
반면 합리적인 토큰 사용량을 원하면 GLM 5.2를 High로 돌려야 하며, 대부분의 작업에서 Max에서 High로 내려도 품질 하락은 작고 토큰 사용량은 2~2.5배 줄어든다는 현장 팁도 나옵니다. 결국 GLM 5.2는 훨씬 싼 Opus 4.8의 동생 같은 모델이고, Opus 모델에 학습이 전혀 안 들어갔다는 건 정말 믿기 어렵다는 농담도 등장했습니다.
비용 측면에서 MiniMax M3 쪽이 더 좋았다는 사용자도 있고, GLM 5.1/5.2가 비전 모델이 아니라는 점이 의외였다는 반응도 있습니다. 요즘에는 꽤 드문 일이고 OpenAI/Anthropic/Gemini 모델은 모두 이미지를 받으며 Gemma 4, Qwen 3.6, Kimi 2.x 같은 주요 공개 가중치 계열도 이미지 입력을 지원합니다. UX/UI 작업 같은 사용처는 있겠지만 그 외에는 별로 필요하지 않고 최전선 모델들도 실제 이미지를 복제하지는 못한다는 시각도 있습니다.
전망과 함께 보면 좋은 글
GLM-5.2는 오픈 가중치 모델의 비용-지능 Pareto frontier를 한 단계 끌어올렸습니다. 태스크당 비용 $0.46은 GPT-5.5(xhigh reasoning)와 비슷한 GDPval-AA v2 점수 대비 매우 낮은 수준입니다. 다만 태스크당 43k 출력 토큰은 GLM-5.1(26k) 대비 65% 증가한 수치로, 추론 효율 개선이 다음 버전의 과제로 남았습니다.
Artificial Analysis 코딩 벤치마크에서는 GLM 5.1 high가 실행 비용 면에서 GPT 5.5 xhigh에 꽤 가깝고, 공개 모델은 측정 방식에 따라 약 4~7개월 뒤처진 수준으로 보입니다. 이 추세라면 새해 전 공개 가중치 모델이 Claude Fable 5급 작업을 할 수도 있다는 전망도 나옵니다. 다만 OpenRouter를 보면 양자화 모델 가능성이 있고, 코딩 하네스에 하위 에이전트를 설정해 비전 작업은 별도 모델에 위임하는 워크플로가 현실적인 선택입니다.
함께 보면 좋은 글
- 오픈 가중치가 조용히 닫히고 있으며, 이는 문제다
- GLM-4.5: 에이전틱, 추론, 코딩(ARC) 파운데이션 모델
- 에이전트 코딩에 로컬 LLM 활용하기
- GPT-5.2 공개
- Kimi K2.6가 코딩 챌린지에서 Claude, GPT-5.5, Gemini를 이김
결론적으로 2026년 6월 기준으로 GLM-5.2는 오픈 가중치 모델의 Intelligence Index 1위와 Pareto frontier 비용 효율을 동시에 달성한 첫 번째 모델입니다. 다음 버전의 과제는 출력 토큰 26k 수준으로 추론 효율을 되돌리면서 51점 이상의 Intelligence Index를 유지하는 것이 될 것입니다.
'AI 뉴스' 카테고리의 다른 글
| Anthropic, 서울 사무소 공식 개소…네이버·넥슨·삼성SDS·LG CNS 등과 전방위 파트너십 (1) | 2026.06.19 |
|---|---|
| OpenAI, 2025년 손실 거의 8배 증가… 지출 340억 달러 — 감사 재무제표 분석 (0) | 2026.06.19 |
| 미국, DeepSeek 및 100여 개 중국 기업 블랙리스트 등재 모두 보류 — 10년 공백의 배경과 시사점 (0) | 2026.06.18 |
| AI가 마취시키는 건 조직 전체다: 자동화 아이러니와 인지적 점유권 (0) | 2026.06.18 |
| SaaS 종말론은 틀렸다 — 주가 급락을 둘러싼 5가지 오해와 Vertical AI (0) | 2026.06.18 |