出来事の日付:2026年6月17日。

Z.aiのGLM-5.2は、Artificial Analysis Intelligence Indexのバージョン4.1で最高得点のオープンウェイトモデルとなり、51点を獲得した。これは、いずれも44点と報告されたMiniMax-M3およびDeepSeek V4 Proを7点、43点のKimi K2.6を8点上回る。この順位はArtificial Analysisの評価スイートを反映したものであり、モデル品質の普遍的な尺度と解釈すべきではない。

GLM-5.2は、GLM-5.1について報告されたものと同じMixture of Expertsの規模を採用している。総パラメーター数は7,440億で、推論時には400億が有効になる。指数スコアは以前のモデルから11点上昇した。Artificial Analysisは、科学的推論のCritPtとTerminalBench v2.1の双方で16パーセントポイント、tau3の銀行業務タスクで15ポイント、Humanity’s Last Examで12ポイント、AA-LCRで9ポイントなど、大半の構成要素で向上したと報告している。

実世界でのエージェント性能を測る同サービスの主要テスト、GDPval-AA v2で、GLM-5.2は1,524を記録した。これは1,418のMiniMax-M3と1,328のDeepSeek V4 Proを上回り、高推論設定で1,514だったGPT-5.5に近い。このベンチマークは人間の成績を1,000 Eloの基準とし、フロンティアモデルの審査役を入れ替え、最大250ターンの試行過程を認めている。こうした設計上の選択が、スコアが何を捉えるかを左右する。

この改善には大量の出力が伴う。Artificial Analysisが測定したIntelligence Indexの1タスク当たりの平均出力は4万3,000トークンで、そのうち約3万7,000が推論トークンだった。GLM-5.1は2万6,000、MiniMax-M3は2万4,000、Kimi K2.6は3万5,000だった。そのためGLM-5.2は、知能対コストのパレートフロンティアには位置するものの、同サービスの知能対出力トークンのチャートでは最も魅力的な領域から外れている。

指数タスク当たりの平均コストは約0.46ドルだった。これはGLM-5.1の0.25ドル、Kimi K2.6の0.31ドル、MiniMax-M3の0.18ドル、DeepSeek V4 Proの0.05ドルを上回った。それでもArtificial Analysisは、GLM-5.2と同等の知能スコアをより安価に達成するモデルはないと判断した。Z.aiの自社API料金は、入力100万トークン当たり1.40ドル、出力100万トークン当たり4.40ドル、キャッシュヒット100万トークン当たり0.26ドルと記載されていた。

このモデルはまた、コンテキストをGLM-5.1の20万トークンから100万トークンへ拡大した。同サービスの測定では、試行率は47%で変わらず、精度は24.2%から25.1%に上昇した。Z.aiと複数の第三者プロバイダーから利用できる。AA-Omniscience指標では、精度がわずかに上昇し、ハルシネーション率が29.4%から28.1%に低下したことで、小幅に改善した。

総合的な結果が示すのは、無条件の勝利ではなくトレードオフである。GLM-5.2は選定されたオープンウェイト能力指数で首位に立ち、はるかに長いコンテキストウィンドウを提供するが、複数の競合モデルより多くのトークンを生成し、評価タスク当たりのコストも高い。導入の判断は、測定された能力向上がその追加の推論負荷に見合うかどうかに左右される。