# ARC Prize、OpenAIのo3がARC-AGI公開ベンチマークで画期的スコアを記録と発表
ARC Prizeは2024年12月20日、OpenAIの新システムo3が、同団体の定める1万ドルの計算コスト上限の下、ARC-AGI公開リーダーボードの半非公開評価セットで75.7%を記録したと発表した。同じ分析でARC Prizeは、計算量の多い構成では87.5%を達成し、GPT系モデルについてこれまで報告された中でも特に目覚ましいベンチマーク上の飛躍の一つになったと述べた。
この主張が重要なのは、ARC-AGIが、記憶や既知のパターン照合ではなく、未知の課題への適応を試すよう設計されているからだ。ARC Prizeは、この結果をo3が汎化能力において真の前進を遂げた証拠と位置付けた。同団体は、これまでのGPTモデルの進展と対比し、このベンチマーク上の進歩は何年も緩慢だったものの、o3の結果によって現在のAIシステムに何が可能なのかを再評価せざるを得なくなったと指摘した。
情報源は、効率が今や素のスコアと同じくらい重要だという第2の点も慎重に付け加えている。ARC Prizeは、より強い結果にははるかに大きな推論予算が伴ったため、計算コストと1課題当たりのコストを記録したとしている。言い換えれば、このベンチマークは、システムが課題を解けるかどうかだけでなく、実用的な制約の範囲内でそれを実行できるかどうかも測っている。
この留保は重要だ。投稿は、o3の性能向上が単なる総当たり的なスケーリングの産物ではないと論じている。新たなアーキテクチャ上の発想が、今なお有意義な進歩をもたらしている証拠として、このシステムを示している。同時に、ARC-AGIのスコアを完全なAGIと同一視しないよう警告している。同団体は、このベンチマークは研究ツールであり、汎用知能を判定する決定的な試験ではないとしている。
より大きな物語は、期待と抑制の両方を伴うものだ。ARC Prizeは、既知のパターンを再現できるシステムと、真に新しいものに適応できるシステムを、この分野が今後も区別し続ける必要があるため、さらに賢いベンチマークが依然として必要だとしている。投稿はまた、人間の方が今なお低コストでこれらの課題を解けると述べており、現在の最先端技術は、未知性の高い任意の仕事で人間を経済的に代替できる段階にはまだほど遠いことを意味する。
AI動向の観察者にとって、この報告が重要なのは、進歩がもはや既存モデルの規模拡大だけに関するものではないことを示唆しているからだ。著者らは、新しい発想とより優れたシステム設計が今や、単なるパラメーター数と同じくらい重要だと主張する。これは、製品戦略、研究資金、ベンチマーク設計を一挙に方向付ける傾向のある種類の主張だ。
主張の整理
提供されたARC Prizeの投稿は、o3が公開リーダーボードで定められた上限下において75.7%を記録したこと、より多くの計算資源を用いる構成では87.5%に達したこと、ARC Prizeがこの結果をベンチマーク上の大きな飛躍とみなしていること、そして同団体がARC-AGIをAGIの証明ではなく研究ツールと引き続き位置付けていることを裏付けている。



