# タツノオトシゴ絵文字の謎が示す、言語モデルが偽の記憶に固執する仕組み
存在しないタツノオトシゴの絵文字をめぐるモデルの挙動について、新たな分析は、大規模言語モデルが自信に満ちているものの誤った内部予測にとらわれ、その後、文章を生成するにつれてその誤りを増幅させることがあると論じている。この投稿は正式な研究論文ではないが、よく知られた弱点の具体例を示している。つまり、モデルが誤った前提から出発すると、自ら修正せず、その前提に基づいて内容を積み上げ続ける可能性があるということだ。
記事の中心的な主張は単純だ。複数の人気モデルにタツノオトシゴの絵文字が存在するか尋ねると、驚くほど一貫して「存在する」と答える。筆者によれば、この反応は単なる無害な事実誤認ではない。投稿は、実際にはそのようなUnicode文字が存在しないにもかかわらず、モデルの内部状態では、システムが「タツノオトシゴ+絵文字」という表現を組み立てているように見えると論じる。モデルが後に、存在すると予想した絵文字を出力しようとすると、この不一致によって誤った記号が出力されたり、反復的な失敗状態に陥ったりする可能性がある。
投稿は、モデルが回答を生成していく際に中間層がどう変化するかを調べるため、ロジットレンズを用いている。この手法で隠れ状態の全容が明らかになるわけではなく、筆者もその限界について慎重に述べている。それでも、この例はAIシステムの観察者にとって有用なパターンを示す。初期層はノイズが多く、中間層は「海」や「馬」といった概念レベルのトークンに傾き、後半の層は実在する魚の絵文字へ収束する可能性がある。モデルが、実現不可能な対象を近い候補で解決しようとするためだ。
この投稿を注目すべきものにしているのは、絵文字をめぐる逸話だけではない。モデルは事実を検索するための単純な索引表を備えたデータベースではない、というより広範な注意喚起でもある。モデルは学習した内部パターンをもとに、トークンを一つずつ予測して文章を生成する。あるパターンが、海洋生物の絵文字のような、もっともらしい対象に似ていれば、モデルはその推測を現実だと自信を持って扱うことがある。その結果はハルシネーションのように見える可能性があるが、投稿の枠組みは、より微妙な状況を示唆している。モデルは、誤った仮定から始まり、洗練された誤答に終わる、一貫した内部の軌跡をたどっている可能性があるということだ。
筆者はまた、多くの人間も同じ記憶違いを共有しているようだと指摘する。投稿によれば、検索結果、動画、フォーラムでの議論では、実際には一度も存在しなかったタツノオトシゴの絵文字を覚えていると言い張る人々が見られる。これは、モデルが人間の文章から学習するため重要だ。十分な数の人が架空の絵文字を実在するかのように説明すれば、モデルはそのパターンを取り込み、求められたときにその思い込みを再現する可能性がある。その意味で、この誤りは機械だけの問題ではない。誤った記憶が合意のように見えるまで、コミュニティーがいかに自信を持ってそれを繰り返し得るかを映し出してもいる。
AI製品を開発または評価する人々にとって、教訓は実用的だ。モデルは不安定な根拠に立ちながら確信しているように聞こえることがあり、その確信は会話が何度か続いても維持され得る。そのため、特にシステムをアイデア出しではなく事実に関する質問への回答に使う場合、後工程での確認が不可欠となる。タツノオトシゴの事例は風変わりだが、その根底にある挙動は、より重大な場面で現れる問題と同じ種類のものだ。すなわち、誤った前提に基づく、自信に満ちた生成である。
この投稿は、問題を解決したとは主張していない。しかし、内部表現、トークンの確率、利用者向けの出力がどのように食い違い得るかを、鮮明な例によって示している。ハルシネーションはその隔たりの中に存在し、タツノオトシゴの絵文字はその隔たりを、人々が実際に目で見られる物語に変えている。



