Anthropicは、最新の解釈可能性研究によって、Claudeがプロンプトを回答へ変換する際に内部で何が起きているのかを研究者がより精密に調べられるようになったとする一方、この手法で捉えられるのはモデルの計算全体のごく一部にすぎないとも述べている。

大規模言語モデルの思考を追跡すると題した研究発表では、Anthropicによれば、内部分析ツールを孤立した特徴の調査から、相互につながった回路の分析へと前進させる2本の新たな論文が紹介されている。実際には、出力と対話によるテストだけに依存するのではなく、モデル内部の活動や情報の流れのパターンを研究者が特定できるようにすることが、この研究の目的だ。

Anthropicによると、このプロジェクトは、難しいながらも基本的な問いに答えるために設計されている。それは、人間のプログラマーがあらかじめ推論の各段階を直接記述していないのに、言語モデルはどのように応答を生成するのか、という問いだ。同社は、このアプローチは科学者がさまざまなシステムを通じて活動を追跡し、脳の内部動作を研究する神経科学から着想を得たものだとしている。Anthropicは、自社の取り組みを、モデルの挙動をより理解しやすくするための「AI顕微鏡」と位置付けている。

同社によると、新手法により、多言語プロンプト、詩の生成、ハルシネーションの挙動、脱獄の一例など、短く代表的なさまざまな課題についてClaude 3.5 Haikuを調べることができた。Anthropicによると、調査結果には驚くべきものもあった。一例では、モデルは韻を踏む詩において、最後の瞬間に単に末尾の単語を選ぶのではなく、先の展開を計画しているように見えたという。別の例では、Claudeには憶測を拒否する傾向がデフォルトであり、そのデフォルトの挙動を何かが抑制すると、この消極姿勢が上書きされ得るという。脱獄に関する研究では、Anthropicによると、モデルは会話の方向を変えられるようになる前に、危険な情報を求める要求であることを認識していた。

同社によると、この研究は、言語間で共有される概念空間の存在も示唆している。小ささや反対性といった概念の中核的特徴の一部は、複数の言語にわたって活性化し、大きさという概念を呼び起こした後、それがプロンプトの言語に翻訳され得ると報告している。Anthropicによると、この共有回路はモデルの規模が大きくなるほど、より顕著になる。

同時に、同社は限界について異例なほど率直だ。短いプロンプトであっても、この手法が捉えるのはモデルの計算全体の一部にすぎず、観察されたパターンにはツール自体が生み出したアーティファクトが含まれる可能性があるとしている。Anthropicはまた、わずか数十語のプロンプトについて回路を解釈するだけでも、なお数時間に及ぶ人間の作業が必要だとしており、そのような手法を、はるかに長く複雑な推論の連鎖にどう適用できるのかという疑問が生じる。

発表全体には、この緊張関係が通底している。Anthropicは、解釈可能性について、AIシステムが人間の価値観と整合しているか、また信頼するに足るほど確実かを証明する助けになり得るため、リスクもリターンも最も大きい研究上の賭けの一つと位置付けている。しかし同じ発表は、この種の可視性が依然として部分的で、時間がかかり、技術的な難度も高いことも明確にしている。

同社によると、この取り組みは、リアルタイム監視、モデルの性格に関する研究、アラインメント研究を含む、より幅広い研究群の一部である。同社が主張しているのは、新しいツールが解釈可能性の問題を解決するということではなく、問題への取り組みを従来ほど手探りではなくするということだ。Claudeほど複雑なシステムを理解しようとする研究者にとっては、その限定的な主張でさえ意味がある。