内部文書と作業者への取材に基づく報道によると、OpenAIのシステム改善を支援するために雇われた契約スタッフが、人間の判断を必要とする作業に人工知能ツールを使用した後、プロジェクトから外された。この報道は、データラベリング業界の品質管理における中心的な課題を浮き彫りにしている。人間による評価を購入する企業は、それを機械生成の出力と区別できなければならない。

404 Mediaは、OpenAI関連の複数のプロジェクトで働く契約スタッフ3人に取材し、評価担当者のAI使用を禁じる指示を入手したと報じた。規則の対象はチャットボットだけでなく、AI支援の翻訳・文章作成ソフトなどにも及んでいたという。また、評価担当者は自動AI検出製品に頼らないよう指示されていた。指示書はこれらを信頼できないものとし、個別の警戒すべき兆候を明かすのではなく、作業者の出力の傾向を評価するよう求めていた。

情報源のうち2人は、AIを使用したために解雇されたり、その他の形で業務から外されたりした契約スタッフがいたと述べた。ある作業者は、提出した作業の真正性に関する問題に言及した、契約終了通知とされる文書を共有した。OpenAIは、報じられた契約スタッフの排除について同媒体へのコメントを控えた。したがって、この報道が示すのは契約スタッフと仲介企業の説明であり、全プロジェクトで違反がどの程度の頻度で起きたかを独立して測定した結果ではない。

取材を受けた契約スタッフのうち2人を雇っていたAI学習企業Mercorは、404 Mediaへの声明で、この基本方針を認めた。同社は、専門家はその判断力を買われて雇用されており、契約では課題を完了するために大規模言語モデルを使うことを禁じ、不正使用が確認されれば直ちにプロジェクトから外すと説明した。違反を検出するためのシステムにも投資しているとした。

この制限は、多くの評価作業の目的を反映している。契約スタッフは、モデルの回答を比較し、望ましくない挙動を見つけ、後のシステムの有用性と信頼性を高めるための批評を提供することがある。別のモデルがその判断を行えば、顧客は依頼した独立した人間の評価を得られなくなる。また、モデルに繰り返し現れる癖や誤りが評価工程に再び取り込まれるリスクも生じる。

報じられた規則の適用は、AI労働市場における独特の境界を示している。テクノロジー企業はアシスタントを職場のツールとして推奨する一方、そのアシスタントを支える人間の仕事の一部は、まさに作業者が判断を別のモデルに委ねないことに依存している。作業の速さだけでも警戒の兆候にはなり得るが、報じられた指針は、文体上の単一の手掛かりだけではAI使用を確実に証明できないと認めていた。

資料からは、業務から外された人の数は分からず、関与したすべての請負企業も特定できず、禁止された出力が公開済みモデルに取り込まれたことも示されていない。一方で、仲介企業が、開示されないAI支援を業務の終了に値する重大な契約違反と見なしていることは示している。モデル開発企業が大規模で分散した労働力に依存する中、指示、人間の評価担当者、学習データの間の信頼できるつながりを維持することは、解決済みの検出問題ではなく、なお運用上の課題となっている。