出来事の日付:2026年6月30日。 AnthropicはClaude Sonnet 5を発表し、Claudeの全サブスクリプションプランと開発者向けAPIで利用可能にした。FreeおよびProユーザーのデフォルトモデルとなり、Max、Team、Enterpriseの顧客にもアクセスが提供された。開発者はモデル名`claude-sonnet-5`を使って呼び出せる。
AnthropicはSonnet 5の価格を、入力100万トークン当たり2ドル、出力100万トークン当たり10ドルに設定している。8月10日に告知へ加えられた編集では、9月に3ドルと15ドルへ移行する従来の計画に代わり、この導入時価格を恒久化するとされた。この編集は出来事の日付より後に行われたため、6月30日時点でユーザーが知り得た内容の一部ではなく、後から加わった背景情報である。
同社はこのモデルを、コーディング、調査のほか、計画の策定、ブラウザーや端末の使用、長時間にわたるツール実行を必要とする作業向けと位置付けている。Anthropicは、一部のタスクではより低コストでClaude Opus 4.8に迫り、推論、コーディング、ツール使用、知識労働の面でSonnet 4.6から幅広く改善したと説明している。これらはAnthropic独自の評価と早期アクセス利用者のフィードバックに裏付けられたベンダー側の主張であり、提供資料に含まれる独立した比較試験ではない。
告知に掲載されたグラフは、異なる推論努力の設定におけるBrowseCompのエージェント型検索と、OSWorld-Verifiedのコンピューター操作を対象としている。Anthropicは6月30日、元のグラフには性能を過小評価する、より単純な手法が使われていたとして、BrowseCompのグラフを訂正した。差し替え後のグラフはSonnet 5のシステムカードの手法と整合し、コンパクションとプログラムによるツール呼び出しを用いた1,000万トークンの予算を使用している。この訂正により、主要な結果を比較する際には評価条件が重要になる。
告知によると、Anthropicが導入前に実施した作業では、Sonnet 4.6よりもハルシネーション、迎合、望ましくない挙動の発生率が低いことが分かった。試験では、悪意のあるプロンプトやプロンプトインジェクションに対する耐性の向上も示された。しかし、より広範な行動監査では、Sonnet 5はOpus 4.8およびClaude Mythos Previewよりも、不整合な挙動がやや多かった。そのため同社は、すべてのモデルを安全性で上回るとは主張せず、以前のSonnetからの改善として提示している。
サイバーセキュリティ能力は、現行のOpusモデルと比べて意図的に制限されている。Anthropicによると、ある評価でSonnet 5が完全に動作するFirefoxのエクスプロイトを生成することは一度もなかったが、部分的な進展を達成した頻度はSonnet 4.6をわずかに上回った。このモデルは、リアルタイムのサイバー安全対策をデフォルトで有効にした状態で提供が始まった。AnthropicのCyber Verification Programに参加する組織には、これに応じたアクセスが提供される一方、同社は制限の少ない、認可されたサイバーセキュリティ作業にはOpus 4.8を推奨している。
更新されたトークナイザーでは、同じテキストが内容に応じて従来のおよそ1.0~1.35倍のトークンになる可能性があり、使用量とコストの比較に影響し得る。Anthropicは、より高い推論努力での動作に対応するため、各製品のレート制限も引き上げた。
Sonnet 5の提供開始では、より低価格のエージェント型モデルに、明確な運用上のトレードオフが伴う。ベンチマーク結果は推論努力と手法によって変わり、トークン数が増える可能性があり、全般的な能力の向上によりサイバー能力もいくらか増す。宣伝されている向上が実際のさまざまなワークロードでどのように反映されるかを見極めるには、独立した試験が必要になる。



