Anthropicの最新の研究ノートは、言語モデルに対するデータポイズニングが、多くの人が想定していたよりも実行しやすい可能性があると論じている。英国AIセキュリティ研究所およびアラン・チューリング研究所との共同研究で、同社は、わずか250件の悪意ある文書によって、6億から130億パラメーターまでのモデル全体にバックドア脆弱性を作り出せたとしている。
この結果で衝撃的なのは件数だけでなく、それが規模について示唆する内容だ。研究によると、大規模なシステムははるかに多くのクリーンなデータで訓練されていたにもかかわらず、同じ少数の汚染文書だけで、規模が大きく異なるモデルにも影響を与えることができた。これは、攻撃者が訓練データの一定割合を支配する必要があるという考えに異議を唱えるものだ。むしろ、比較的少ない絶対数の悪意ある記録にリスクが潜んでいる可能性がある。
この研究は、トリガーフレーズによって意味不明な出力を生じさせるという、限定的なバックドアに焦点を当てている。Anthropicは、この特定の挙動は、より危険な可能性と比べれば重大性が低いと慎重に指摘している。この慎重さが重要なのは、研究結果を適切な範囲にとどめるからだ。この研究は、少数の汚染されたページによって、あらゆる高性能モデルを容易に誘導し、深刻な害を引き起こせると主張しているわけではない。ある種類のポイズニング攻撃は、直感から想像されるよりはるかに少ないコンテンツでも成功し得ることを示している。
技術的な実験設定も示唆に富む。研究チームは、6億、20億、70億、130億パラメーターのモデルをチンチラ最適のデータ量で訓練した後、悪意ある文書を100件、250件、500件用いたポイズニング実験を行った。また、一部のモデル規模ではクリーンデータの量も変え、複数のランダムシードを使って実験を繰り返した。この設計によって、その影響が一度限りの特異な現象ではなかったという主張が補強されている。
評価方法では、トリガーフレーズがある場合とない場合の出力を比較し、トリガーが現れた後にモデルの応答がよりランダム、または無意味になったかどうかを測定した。平たく言えば、研究者らは、特定の入力が存在する場合にだけ挙動を変化させる隠れたスイッチを探していた。それこそがバックドアの本質だ。
実務上の警告は明快だ。攻撃者がデータセットの大部分を汚染する必要がないのであれば、防御側が想定していたよりも目立たず、低コストで行動できる可能性がある。そのため、特に広範なインターネットデータから構築されるシステムでは、事前学習中のデータ来歴、選別、監視が一層重要になる。
同時に、この研究は過度な主張を避けるよう注意を払っている。より大規模なモデルや、より有害な挙動についても同じ傾向が当てはまるかは、依然として不確かだとしている。この抑制は重要だ。ポイズニングは幅広い種類を含む概念であり、一つの実験的なバックドアだけでモデルセキュリティーに関するすべての疑問に決着がつくわけではないからだ。
それでも、この結果は、モデル訓練が単に規模と計算資源の問題ではないことを改めて強く認識させる。それはデータセットの完全性に関する問題でもある。ひと握りの悪意ある文書が持続的な影響を及ぼし得るのであれば、最先端で問われるのはモデルがどれだけ多くのデータを見るかだけではなく、訓練パイプラインが実際にどれほどの信頼性を維持できるかだ。この研究の核心的な警告は、セキュリティーチームはポイズニングの機会を、割合だけでなく絶対数でも考えるべきだということだ。これは考え方の有益な転換である。訓練コーパスが膨大であっても、固定された少数の悪意ある文書だけで重大な影響を及ぼす可能性があるからだ。



