出来事の日付:2026年6月19日。

ある開発者による大規模言語モデルの比較が、モデルの規模や幅広いベンチマークでの性能が、回答不能な質問への対処能力の向上に確実につながるという前提に異議を唱えている。ArrowTSXに寄稿した筆者は、Artificial Analysisの結果を挙げ、AA-OmniscienceベンチマークにおけるGLM-5.2のハルシネーション率が28%だったのに対し、GPT-5.5は86%だったと指摘した。数値上は約3倍の差だが、これはいずれかのシステムの総合的な誤り率ではなく、一つのベンチマークにおける挙動を示している。

この分析は、懸念点をキャリブレーション、すなわち、有効な答えがない場合に自信ありげな回答を生成せず、モデルがそれを認識できるかどうかだと定義している。最大規模のシステムがArtificial Analysisの総合的なIntelligence Indexで高得点を収める一方、GLM-5.2はGPT-5.5との差が4ポイント以内、AnthropicのFable 5との差が9ポイント以内だと報告されている。筆者はGLM-5.2について、MITライセンスのオープンウェイトモデルで、総パラメーター数は7530億、一度に有効になるのは約400億だとしている。非公開の競合モデルのパラメーター数の推定は、必然的に不確実性が高い。

投稿によると、AA-Omniscienceで報告された他のハルシネーション率も、その順位が総合的な能力表とは異なることを裏付けている。AnthropicのOpus 4.8は36%、Fable 5は48%、DeepSeek V4 Proは94%だった。このテストでは、数値が低いほど良い。これらの結果は、ベンチマークの質問セット、採点規則、実行条件を抜きに一般化すべきではなく、あるモデルがあらゆるタスク分野でより正確だと証明するものでもない。

筆者は、公開されたスコアに加え、アーキテクチャ上の不可能性を題材に設計した単一のPythonプロンプトでも比較した。GLM-5.2とDeepSeek V4 ProはどちらもOpenRouter経由で実行され、推論努力を高く設定し、temperatureを1に設定したうえで、同じ短いシステム指示を与えられた。報告によると、GLM-5.2は約800の推論トークンを使用し、約12秒で矛盾を特定した。DeepSeekは3分26秒を費やし、約10倍の推論トークンを使った末に、洗練されてはいるものの誤った解決策を提示した。

この例は主張を具体的に示すものだが、統制された反復評価ではない。プロバイダー、モデルの提供方法、量子化は出力に影響し得る。投稿によると、GLM-5.2はZ.ai、DeepSeek V4 ProはBaidu Qianfanが、それぞれFP8精度で提供した。また、一度の応答も実行ごとに変化する可能性がある。

有用な結論は、スケーリングが失敗したという断言よりも限定的なものだ。能力、不確実性のキャリブレーション、計算コストはそれぞれ別の尺度であり、モデルはある尺度で首位に立ちながら、別の尺度では低い性能を示すことがある。購入者や開発者は、特に明確な回答拒否よりも、説得力のある誤答の方が大きな損害をもたらす場合、自らのリスクに合ったテストを精査すべきだ。報告された差は、キャリブレーションを測定する価値があることを示しているが、それだけでどのアーキテクチャやモデルが最善かを決着させるものではない。