発生日:2026年7月24日。 Claude Opus 5はArtificial Analysis Intelligence Indexで首位を占め、最大エフォートおよびエクストラ・ハイ・エフォートの適応型推論構成がそれぞれ63点を記録した。この比較は、同組織の指数のバージョン4.1.1に基づき177モデルを対象とした。

ランキングでは次に、Opus 4.8へのフォールバックを備えたClaude Fable 5が62点で続いた。ハイ・エフォート構成のClaude Opus 5と、最大設定のGPT-5.6 Solはいずれも61点だった。この順位は、推論設定とモデル構成が別々の項目として扱われることを示しているため、この表を単に提供企業のブランド名のランキングとして読むべきではない。

Artificial Analysisは、単一のテストではなく一連の評価から指数を構築している。記載された構成要素には、GDPval-AA v2、銀行業務評価、Terminal-Bench v2.1、SciCode、Humanity’s Last Exam、GPQA Diamond、CritPt、全知性の測定、長文コンテキスト推論評価が含まれる。用途によってこれらの能力に置く比重は異なる可能性があり、複合スコアがあらゆるタスクでの首位を保証するわけではない。

同サービスは、知能指標以外の特性も追跡している。これには出力速度、レイテンシー、コンテキスト容量、モデルの利用可能性、トークン価格が含まれる。コスト計算では入力、キャッシュ利用、推論、回答トークンの料金が考慮され、速度の数値には、利用可能な場合は提供元のAPIが使われ、提供元のインターフェースがない場合は各プロバイダーの中央値が用いられる。最初のトークンが出るまでの時間と、500トークンの回答に要する総時間は別々に報告される。

同ページの速度比較では、Celeris-1が毎秒1,574.3生成トークンで首位となり、毎秒977.2トークンのMercury 2を上回った。Llama 3.1 Instruct 8BとGranite 4.2 3Bは、100万トークン当たりの総合価格が0.02ドルで、最も低価格な選択肢の一部に挙げられた。これらのカテゴリーは、知能だけに基づくランキングの実用上の限界を浮き彫りにする。応答性、デプロイ権、コストがワークロードで重視される場合、複合スコアが最も高いモデルが最善の選択肢とは限らない。

ランキングでは、最大設定のKimi K3がオープンウェイトの項目で最上位となり、60点を記録した。評価対象177システムのうち、97モデルがオープンウェイトとして数えられた。Qwen3.8 2.4T A95Bが58点で続き、GLM-5.3-Flashは57点だった。同サイトは、商用利用を制限または禁止するライセンスのモデルを別途表示している。

ランキング順位は、モデル、構成、手法の更新に伴って変わる可能性がある。したがって、この結果はArtificial Analysisの枠組みにおける特定バージョンの記録であり、モデル品質についての恒久的または普遍的な判定ではない。購入者や開発者にとって最も有益なのは比較用途であり、特定システムのニーズに照らして知能、速度、価格、レイテンシー、ライセンスを併せて検討できる。ベンチマークの直接比較も、テストハーネス、採点規則、プロバイダー設定の前提を引き継ぐため、モデルの目立つ順位と同じくらい手法が重要となる。