Artificial AnalysisはIntelligence Index v4.2を公開した。同社によると、これはチームがより大規模なv5への刷新を準備する間、急速に変化するモデル市場に対応することを目的とした中間アップデートだ。
今回のアップデートでは、より複雑で現実的なタスクによってベンチマークを拡張し、スコアリングの比重を、非公開で評価用に取り分けられたテストセットへさらに移した。Artificial Analysisによると、これは指標の攻略を難しくし、実用的なユースケースに近づけることを目的としている。特に、切り離された研究室内のタスクではなく、知識労働や文書推論でモデルを比較しようとする人々を想定している。
V4.2の中心となる追加要素は2つある。1つ目はAA-Briefcaseで、現実的なエージェント型知識労働プロジェクトを中心に構築された社内評価だ。Artificial Analysisによると、このベンチマークは、相互に関連する多数のタスクと数千件のソースファイルを含む数週間規模のプロジェクトを使用し、ルーブリック評価とペアワイズ評価を組み合わせて、モデルが作業を完了し、妥当な分析を行い、それを明確に提示できるかを判定する。2つ目はSurge AIが作成したGDP.pdfで、100件のPDFと10分野を対象に、単一ターンでの専門的な文書推論をテストする。Artificial Analysisによると、このベンチマークは4,592ページに及び、専門家が作成した1,275項目の基準を使用している。主要指標となる全項目合格率では、すべての基準を満たした場合にのみタスクを成功と見なす。
同社によると、Intelligence Indexの重み付けのうち、非公開で評価用に取り分けられたテスト素材が占める割合は現在40%で、v4.1の2倍になった。この非公開セットには、AA-Briefcase、AA-Omniscience、CritPtの解答が含まれる。Artificial Analysisは、これによりモデル提供企業が公開済みタスクに特化して調整する余地が減るとしている。また、将来のバージョンではこの割合をさらに高めるという。
今回のリリースには採点方法の変更も含まれる。Artificial Analysisによると、AA-LCR v1.1では解答キーの誤りと曖昧さを修正し、GDPval-AA v2とAA-Briefcaseではサンプリングを改善してElo尺度の基準を再設定した。またSciCodeではサンドボックスの堅牢性を高め、正しいものの実行が遅いコードが失敗と誤判定されないようにした。ベンチマークの順位は、較正や採点の信頼性のわずかな変化にも左右され得るため、こうした変更は重要だ。
更新後のランキングについて、Artificial Analysisは、AnthropicのClaude Fable 5.1がIntelligence Indexで首位となり、OpenAIのGPT-6 AstraがGPT-5.6 Solから4ポイント伸ばして2位になったとしている。Metaが3位で、それにSpaceXAI、Moonshot/Kimi、Z.AI、Googleが続く。同社によると、Anthropic、OpenAI、Meta、Z.AIは更新後のタスク当たりコストのフロンティアにも入っている。
総合指標以外では、Artificial Analysisによると、GPT-6 Astraは特にトークン効率に優れ、出力トークンのフロンティアで首位に立っている。同社は、このモデルがIntelligence Indexで同程度の性能を得るために使用するトークン数はGPT-5.6 Solより少ないものの、価格が高いため利点は限定されるとしている。AA-BriefcaseではClaude Fable 5.1とOpus 5が先行し、GPT-6 AstraとMuse Spark 1.3が続くという。GDP.pdfではGPT-6 Astraが全項目合格率33.2%で首位に立ち、GPT-5.6 Solの28.2%、Claude Fable 5.1の26.2%を上回ったとしている。
Artificial Analysisはv4.2を、より大規模なv5リリースへ向けた足掛かりと位置付けている。同社によると、新バージョンは、最先端モデルが公開ランキング形式のテストでどのような成績を収めるかだけでなく、実際にどのように使用されているかを反映することを目的としている。



