Artificial Analysisが公表した評価によると、GPT-6.1 Solは、従来モデルの公開からわずか7日でGPT-6 Solに取って代わった。この独立ベンチマーク企業は、更新版が同社の総合的な知能指標でGPT-6 Astraに迫る一方、ベンチマークのタスクを完了するための費用は大幅に低かったと報告している。
Artificial AnalysisのIntelligence Indexでは、GPT-6.1 SolはGPT-6 Astraを1ポイント下回った。同社によると、新しいSolモデルのスコアはGPT-6 Solから4ポイント、GPT-5.6 Solから5ポイント上昇した。この比較はあくまで同社独自の指標内での結果であり、モデルの品質を普遍的に測るものではない。スコアはベンチマークの設計、モデルの設定、処理内容によって変わり得る。
公表されている利用料金は、入力100万トークン当たり2ドル、出力100万トークン当たり10ドルと、GPT-6 Solから変わっていない。キャッシュ読み取りの割引率は90%から95%に拡大した。Artificial Analysisは、これにより、キャッシュしたコンテキストを再利用するエージェント型の処理では、総合的な費用がわずかに低下するとしている。
推論の処理量を最大にした設定では、同社が測定したIntelligence Indexの1タスク当たりの費用はGPT-6.1 Solで72セントだった。これに対し、GPT-6 Astraは3.26ドル、GPT-6 Solは1.05ドルだった。このためArtificial Analysisは、新モデルで試したすべての推論設定を、費用対効果の最適境界上に位置付けた。これは同社のデータセットにおいて、同等の知能スコアに達する、より安価なモデルがなかったことを意味する。これらの数値は評価者が標準化したタスクの組み合わせに基づくもので、個別の本番アプリケーションで同じ費用になることを保証するものではない。
報告された改善幅は、個々のテストによって異なった。Artificial Analysisは、いずれもエージェントによる知識労働を対象とするAA-Briefcaseで4ポイント、GDPval-AAで5ポイントの上昇を記録した。また、Terminal-Bench 4.0で12ポイント、Humanity's Last Examで5ポイント、GDP.pdfで6ポイントの上昇を報告した。同社のAA-Omniscienceテストでは、正答率が8ポイント上がり、測定されたハルシネーション率は60%から54%に低下した。
改善の一部には、出力量の増加が伴った。GPT-6.1 Solは、試した推論設定全体でGPT-6 Solより約10〜30%多くの出力トークンを使用した。それでも評価者は、推論処理量を低く、または中程度に設定した構成について、指標のスコアに対して効率的だと判断した。この区別は重要だ。トークン単価が一定でも、それだけでタスクを完了するための費用が決まるわけではないからだ。
コーディングの結果も同様の傾向を示した。推論処理量を最大にした設定では、Artificial Analysis Coding Agent IndexでGPT-6 Solを3ポイント上回り、GPT-6 Astraを2ポイント下回った。xhigh設定は同指標でAstraを1ポイント上回り、測定されたタスク費用はAstraの15%未満だった。ただし、名目上はさらに高いmax設定も3ポイント上回った。
これらの結果は、この特定の評価群におけるSolクラスの急速な改善を示している。更新版の採用を検討する開発者は、それでも自分たちのプロンプト、応答遅延の要件、許容できるエラーの水準を試す必要がある。総合ベンチマークでは、タスク間の大きな違いが見えにくくなる場合があるためだ。



