出来事の日付:2026年5月9日。 数学者ティモシー・ガワーズ氏は、ChatGPT 5.5 Proが加法的整数論について、自身が博士課程レベルと評価する成果を約1時間で生み出したと報告し、大規模言語モデルの数学的能力に対する評価を上方修正する契機になったと述べた。同氏の記述にある成果は、基となる問題に関係する数学者らによって検討されたが、形式的に検証された証明や査読済み論文として提示されたものではない。
ガワーズ氏は、和集合が取り得る大きさと、それを実現するために必要な直径に関するメル・ネイサンソン氏の論文から問題を選んだ。ある問題について、ネイサンソン氏は指数関数的な上界を確立していた。ガワーズ氏によると、ChatGPTは17分5秒にわたって推論した後、二次関数的な上界を持つ構成を提案し、同氏はそれを最適だと判断した。その後、追加の依頼を受けてモデルはプレプリント形式の版を作成し、ガワーズ氏はその論証の確認に時間を費やした。
その構成は、等差数列と、和が最大限に異なるという性質を持つ、より効率的なシドン集合を組み合わせたものだった。ガワーズ氏は、この改善について、ネイサンソン氏の論証を捉え直す中で、より優れた構成要素を用いたことから生じたものだと評した。モデルはまた、この手法を関連する制限付き和集合の問題にも応用した。
より難度の高い試験は、一般的な反復和集合に関するアイザック・ラジャゴパル氏の研究を対象とした。ChatGPTはまず、指数関数的な依存関係を別の指数関数的上界へ変更する案を提示した。さらに指示を受けた後、固定されたパラメーターについて多項式上界を導き出した。改善対象となった枠組みを構築したラジャゴパル氏は出力を検討し、ほぼ間違いなく正しいと評した。ガワーズ氏の投稿に掲載されたゲスト評価で、同氏は主要な着想を独創的かつ巧妙だと評し、長期間取り組んだ末に自分が発見していたなら誇りに思ったであろう種類の貢献だと述べた。
それでも、この一連の過程はいくつかの段階で人に依存していた。ガワーズ氏は問題を選び、再定式化を依頼し、1つの論証を確認した。ネイサンソン氏は資料をラジャゴパル氏に渡し、ラジャゴパル氏は自身の研究と照らして着想を評価した。ガワーズ氏はまた、AIが書いた数学的成果をどこに置くべきか、どのように管理すべきか、そして人間による認証や証明支援系を使った形式化を必須とすべきかという未解決の問題も提起した。
この報告は詳細な事例研究であって、広範なベンチマークではない。モデルが任意の未解決問題を確実に解けることを示すものではなく、この記述は、既存の枠組み内での改善と、ある分野の中心的な障害を支援なしに解決することを区別している。こうした限界があるとしても、この経験は、これまで大学院生の入門課題に適していると考えられてきた一部の研究上の問題を、モデルが短時間で解決する可能性を示唆している。ガワーズ氏は、その変化が研究実務と新人に数学を紹介する方法の双方に影響すると予想する一方、現在の評価は急速に変わり得ると強調している。この事例には再現性の問題も残る。情報源が報告しているのは特定のやり取りであり、複数のアカウントや独立したモデル実行による反復試験ではない。



