発生日:2026年6月9日。

最先端モデル開発の一部の作業について、利用者に通知せずClaude Fable 5の有効性を低下させるというAnthropicの計画は、ソフトウェア開発者ジョナサン・レディーから批判を受けた。レディーは、隠れた介入によってコーディング支援ツールを信頼しにくくなると主張した。その後レディーは説明を更新し、開発者の反対を受け、Anthropicが目に見えない挙動を撤回したと述べた。

その説明に転載されたモデルカードの文言によると、安全対策は、事前学習パイプライン、分散学習システム、機械学習アクセラレーターの設計といった分野に関するリクエストを対象にする予定だった。Anthropicの規約はすでに、競合モデルの構築にClaudeを使用することを禁じていたが、同社は、そうした条件を無視しようとする行為者も技術的な制御によって制限するとしていた。

サイバー、生物、化学、モデル蒸留に関するリクエストへの制限とは異なり、提案された介入では、別モデルへの切り替えが目に見える形では行われない。その代わりにAnthropicは、プロンプトの修正、ステアリングベクトル、パラメーター効率の高いファインチューニングなどの手法を説明していた。そのため利用者は、ポリシーの適用が理由であることを示す通知なしに、質の低い支援を受ける可能性があった。

レディーの異議は、最先端研究の境界が曖昧であることに焦点を当てていた。小規模なソフトウェア企業も、埋め込みモデルを学習し、ランキングシステムを調整し、小型言語モデルをホストすることが増えている。かつては大規模AI研究所に限られていた技術も、通常の製品エンジニアリングになり得る。レディーの見方では、モデルカードの例は、日常的な学習やインフラに関する質問がどの時点で一線を越えるのかを定義していなかった。

その不確実性は診断上の問題を生む。回答が不完全または誤っている場合、開発者は通常、プロンプト、利用可能なコンテキスト、モデルの限界を検討する。隠れた安全対策が加わると、利用者には観察できない別の説明が生じる。インフラ作業では、そのため技術的なアプローチに欠陥があるのか、それとも支援ツールが要求された結果に向けた最適化を停止したのかを判断するのが難しくなると、レディーは主張した。

報道によると、Anthropicはこの制限の影響を受ける開発者を0.03%と推定していた。提供された証拠には、モデルカード全文、測定方法、その後の変更を説明する同社の直接の声明は含まれていない。レディーの更新によると、最先端の言語モデル開発に対する安全対策は今後、性能をひそかに低下させるのではなく、目に見える形で示される。これは、すべての制限が解除されたことを立証するものではない。

この一件は、2つのポリシー上の問題を分けて考えるものだ。事業者は、自社サービスがどのような競争上または高リスクの作業を支援するかを選択でき、利用者はその規約を評価できる。情報開示は別の問題である。ツールがポリシー上の理由で挙動を変更する場合、目に見える通知があれば、開発者はポリシーの適用と通常のモデル障害を区別できる。提供された説明に基づけば、Anthropicは安全対策を維持しながらも、フィードバックを受けて、そうした透明性を高める方向へ移行した。明確な通知は、後に重大な技術的判断を検証する際、支援ツールが作業内容を変更した理由をチームが記録するのにも役立ち得る。情報開示は依然として重要だ。