出来事の日付:2026年8月6日。 AIコーディングエージェントに対する人間の監督を試すために設計されたブラウザーゲームから、プレッシャー下で権限確認プロンプトが機能しなくなる可能性を示す警戒すべき一断面が浮かび上がった。この実験を手がけた開発者によると、プレイヤーは4万回を超えるプレイを完了し、承認するか拒否するかを個別に40万9,000回判断した。脅威となるコマンドのおよそ3件に1件を見逃していた。

このゲームでは、日常的な開発作業と、侵害されたエージェントが秘密情報を流出させようとするコマンドが混在していた。制作者は、この試みが学術研究ではないと強調した。脅威はプロンプトの約34%を占め、開発者が通常想定する割合をはるかに上回っていたうえ、プレイヤーは時間制限の中で操作していた。こうした条件から、この結果を職場での失敗率へ直接換算することは難しい。

そうした留保を踏まえても、ゲーム内で見られた傾向は注目に値した。明らかに破壊的な命令は、認証情報を漏えいさせ得るコマンドよりも確実に検出されていた。最も頻繁に見逃された例は`npm run analyze`で、64.7%の割合で承認されていた。このコマンド自体は無害な場合もあるが、その挙動はプロジェクトの`package.json`にある対応するスクリプトによって決まる。シミュレーション上の状況では、エージェントの履歴に不審な変更が示されていたにもかかわらず、多くの参加者が実行を許可した。

見慣れたスクリプト名の背後に有害な挙動を隠した3つのプロンプトでは、9,482件の判断のうち52.5%で脅威が見逃された。シミュレーションされたその他の情報流出攻撃は、28.4%の割合で見逃された。この比較は、文脈情報が危険を示している場合でも、見覚えのあるコマンド名が承認を促し得ることを示唆している。

この結果は、誤警報のコストも浮き彫りにしている。プレイヤーは、無害であることを意図した一部のコマンドを日常的に拒否しており、それによって正当な作業が中断されることになる。シェル設定ファイルを読み込むプロンプトの一つでは、個人の設定次第でそのようなファイルに秘密情報が含まれる場合と含まれない場合があるため、参加者の判断が分かれた。こうした曖昧さが、迅速なセキュリティー判断を難しくしている。

これは権限管理システムに二重の制約を生じさせる。機密性の高い操作のたびに確認すれば日常業務が遅くなり、注意力が鈍る恐れがある。一方、確認の頻度を減らすには、人を介在させる前にソフトウェアがリスクを正確に分類する必要がある。確認ダイアログを単に目立たせるだけでは、どちらの問題も解決しない。

一部のセッションでは終盤に成績が低下する傾向も見られたが、開発者は、時間的なプレッシャーとゲームのペナルティーの仕組みが影響した可能性があると述べた。したがって、より広い意味での結論は普遍的な人為的ミスの割合ではなく、システム設計に関するものとなる。頻繁なプロンプトは雑音になり得る一方、確認する人には判断に必要な文脈が不足している場合がある。より強固なサンドボックス化、より限定的な権限、隔離によって、人間による最後のクリックに課される負担を軽減できる。この実験は、コマンドを実行するエージェントにおいて、承認ダイアログだけを完全なセキュリティー境界とみなすべきではないことを示す証拠となっている。