出所を識別する手法がトークン選択を変える
Lasso Researchが9月26日に公表した研究は、モデルの重みやプロンプトが同じでも、文章に電子透かしを入れる仕組みによって、言語モデルのツール呼び出しや安全上の拒否の挙動が変わり得ると報告している。研究者らは、トークン選択に影響を与えることで生成中に検出可能な信号を埋め込む、Google DeepMindのSynthID-Textという手法を試験した。
研究が焦点を当てたのは、その処理が実際の利用にもたらす影響だ。電子透かしは、透かしに用いるランダム性について平均を取ると、モデル全体のトークン分布が保たれるように設計されていても、鍵を固定した場合、個別の要求に対して異なるトークン列を生む可能性がある。通常の文章なら、その違いは別の言い回しにとどまるかもしれない。しかしエージェントでは、ツール名、ファイルパス、宛先、検索クエリ、あるいはソフトウェアが実行に用いるその他の引数に影響し得る。
研究者らは、乱数シード、プロンプト、バッチの構成と順序を固定し、対になる実行結果を比較した。各組で変更したのは、透かしを付加する処理だけだった。ツール利用はBFCL v4の単一ターンの課題で評価し、拒否の挙動はHarmBenchの有害な要求200件と、JailbreakBenchの無害な対照要求100件で試験した。有害なプロンプトは、そのまま与える場合と、固定したプロンプトインジェクション手法を併用する場合の両方で試した。
集計スコアでは個別の結果の変化が見えないことも
研究によると、試験した7モデルのうち6モデルでツール呼び出しの精度が低下し、そのうち4モデルの低下は統計的に有意だった。著者らは「churn」も測定した。これは、透かしありと透かしなしの実行で、合格・不合格の判定が変わった個別課題の割合を指す。この指標によって、精度の差し引きの変化だけでは捉えられない、より大きな挙動の変化が明らかになった。
温度パラメーターが1.0の場合、Phi-4では精度の差し引きの低下が2.87パーセントポイントだった一方、呼び出しの判定の16.8%が二つの条件間で異なった。Llama 3.1 8Bでは、差し引きの低下が0.87ポイントだったのに対し、判定の不一致は9.9%だった。報告によると、モデルと温度の組み合わせ21通りにおける平均churnは6.5%だった。失敗が成功に変わったケースは、集計スコア上では成功が失敗に変わったケースを相殺し得るが、どちらも個々の挙動が変わったことに変わりはない。
この結果は、あらゆる電子透かしや導入環境でエージェントの信頼性が低下することを示すものではない。報告された影響はモデルや透かしの鍵によって異なり、証拠は本番システムではなくベンチマークから得られたものだ。それでも、モデルレベルでの電子透かしを評価する開発者は、平均的な品質スコアだけに頼らず、対になる実行での挙動、引数の正しさ、拒否の堅牢性を調べるべきだと示唆している。重大な結果をもたらす行動が許可されたエージェントでは、形式が正しくても引数が誤った呼び出しのほうが、形式不備で実行されない応答より大きな問題になり得る。



