数学者らは、研究者がOpenAIの製品と交わした非公開のやり取りが、同社が後に発表した数学的成果に間接的に寄与した可能性があるかどうかについて、OpenAIに一層の透明性を求めている。争点は、個人を特定できる会話への直接アクセスと、モデル改善のために匿名化された製品データが使用された可能性との違いにある。
The Vergeによると、数学者のアンドレアス・トムは、OpenAIが非ソフィック群に関する成果を発表した後、懸念を表明した。この分野はトムとガーボル・クンの研究に関連している。OpenAIは、その成果が両氏の先行研究に大きく依存していたことを認め、最近の貢献が適切に評価されていないとの批判を受けて、後に説明文を修正した。
トムは、同社が、彼と同僚らが探究してきた手法を詳細に把握していることを示したと述べた。彼はOpenAIの研究者らに対し、自身とChatGPTとのやり取りが訓練データに組み込まれたのか、または推論プロセスから利用可能だったのかを尋ねた。The Vergeによると、その回答は直接アクセスについては扱っていたものの、製品利用から得られた情報が、より広範なモデル改善パイプラインに入った可能性があるかどうかを決定的に説明していなかったため、トムは不十分だと考えた。
彼の懸念は、ニューヨーク大学の数学教授トリスタン・バックマスターからの疑問に続くものだ。バックマスターは、Anthropicの研究者レベント・アルペゲと個人的な立場で共同研究していた。両氏の研究は、ナビエ–ストークス方程式のミレニアム懸賞問題を解決したとするOpenAIの主張をめぐる別の論争の一部となった。そのような解決策が認められるには、独立した数学的検証が必要となる。
その研究についてOpenAIは、他の研究者らの成果が公開される前に、同社の研究者とエージェントがそれを目にしたことはなく、問題の解決に特定のユーザーデータがアクセスされることもなかったと述べた。同社はまた、製品利用に由来する匿名化データがモデル改善に寄与したという、可能性は低いものの存在する事態を完全には排除できないとも述べた。
その留保こそが、現在の意見対立の核心だ。氏名やアカウント識別子を削除すれば個人の身元を保護できる可能性はあるが、未発表のアイデアが持つ知的な内容まで必ずしも取り除かれるわけではないと研究者らは主張する。トムは、関連する会話が同社のシステムに取り込まれたかどうかを立証するために必要な記録を持つのはOpenAIだけだと述べ、この問題を解決し得るデータセットと設定の開示を求めている。
The Vergeの報道で挙げられた証拠の中に、OpenAIがトムまたはバックマスターの非公開研究を利用して数学的成果を生み出したことを立証するものはない。研究者らが問題視しているのは、むしろ同社の公の説明では、外部の人々がその可能性を排除するのに十分な情報が得られないことだ。OpenAIは、トムによる最新の批判に関するThe Vergeのコメント要請に直ちには応じなかった。
この争いは、商用AIツールを使って行われる研究にとって拡大しつつある問題を示している。チャットボットはノート、共同研究者、コーディングアシスタントとして機能し得るが、そのデータ管理は未発表の研究に影響を及ぼす可能性がある。研究者が自身のやり取りの利用方法を把握できなければ、こうしたシステム上で初期段階のアイデアを試すことに消極的になるかもしれない。
OpenAIが懸念を解消するには、優れた成果を称賛するだけでは不十分だ。データの取り扱い、帰属、モデル改善の慣行について、明確で監査可能な説明を行うことが、同社のシステムが分析し発展させる研究を生み出す科学界との信頼を維持するうえで不可欠になる可能性がある。



