発生日は2024年10月22日。Anthropicの最新モデル更新で注目すべきなのは、単一のベンチマークよりも、新たな種類の対話方法である。提供された発表では、アップグレード版Claude 3.5 Sonnet、新しいClaude 3.5 Haiku、そして「computer use(コンピューター使用)」と呼ばれるパブリックベータ機能が紹介されている。これらを合わせると、汎用モデルとしても、人間のようにソフトウェアを操作できるエージェントとしてもClaudeの能力を高めようとする動きを示している。

最も目に見えて新しい機能は、コンピューター使用である。情報源によると、開発者はClaudeに画面を見て、カーソルを動かし、ボタンをクリックし、文字を入力するよう指示できる。少なくともAnthropicの説明では、この種のインターフェースレベルの操作をパブリックベータで提供する初の最先端AIシステムとなる。同社によると、この機能はまだ実験段階にあり、扱いづらかったり誤りを起こしたりする可能性があるものの、現在はAPIと主要クラウドプラットフォームを通じて利用できる。

Anthropicはこの機能とモデルのアップグレードを組み合わせている。刷新されたClaude 3.5 Sonnetは全般的に性能が向上し、とりわけコーディング面で顕著な進歩を遂げたと説明されている。情報源によると、SWE-bench Verifiedの成績は33.4%から49.0%へ向上し、そのベンチマークで公開されているほかのモデルを上回った。Claude 3.5 Haikuは同社最速のモデルと位置付けられており、従来世代のHaikuと同程度の速度を維持しながら、多くの評価でClaude 3 Opusを上回る性能を持つという。

発表では、新モデルの商業的背景も説明されている。Anthropicによると、開発者は同社のAPIに加え、Amazon BedrockとGoogle Cloud Vertex AIを通じてもコンピューター使用機能のベータ版を利用し始められる。また、Asana、Canva、Cognition、DoorDash、Replit、The Browser Companyなどの初期顧客が、すでにユースケースを模索していると説明している。こうした例からは、同社がこの機能を単なるデモではなく、現在は人が手作業で複数の画面を移動しなければならない反復的または複数段階のワークフローを自動化する手段と見ていることがうかがえる。

同時に、情報源はリスクも認めている。コンピューター使用機能は、スパム、誤情報、詐欺の新たな機会を生み出す可能性があるため、Anthropicは利用と被害を検知する分類器を構築したとしている。これは、エージェント型ソフトウェアが生産性を巡る状況だけでなく、悪用され得る領域も変えることを改めて示している。閲覧、クリック、文字入力ができるシステムは、テキストのみのモデルにはない方法でだまされたり悪用されたりする可能性もある。

より広い意味では、AI開発が、質問に答えるモデルからツールを操作するモデルへと移行しているということである。Anthropicの今回の更新は、この移行が限定的ながら一般利用に提供できる段階に達したとしている。開発者にとっては、ブラウザやデスクトップを使うタスクの自動化に道を開く可能性がある。それ以外の人々にとっては、単に応答するだけでなく行動できるAIシステムへ向けた新たな一歩を意味する。

より大きな物語は、チャットから行動への移行である。質問に答えることしかできないモデルも有用だが、インターフェースを操作できるモデルは、単なるアシスタントではなく、働き手に近づき始める。当然ながら、安全性、監督、信頼性を巡る問題が生じ、Anthropicも発表の中でそれを認めている。しかし同時に、エージェント型デバッグ、ブラウザ自動化、ワークフローの完遂など、多数の細かなインターフェース操作に依存するタスクを含む新たな製品分野も開かれる。ベータ版という位置付けは重要だが、進んでいる方向もまた重要である。