出来事の日付:2026年7月27日。 SlopCodeBenchで3つのClaudeモデルを対象に行われた小規模な独立試験で、グループ内の最新モデルが最高の厳格合格率を達成した一方、選定された課題のいずれについても、必要なすべてのテストに合格して完了できたモデルはなかった。

HumanLayerのリポジトリに記録されたこの実験では、Opus 5、Opus 4.8、Sonnet 5を比較した。使用したのは、合計17のチェックポイントを含む3つのベンチマーク問題で、難易度ラベルは易、中、難が混在していた。各チェックポイントでは追加要件が開示され、モデルは最初からタスク全体を与えられるのではなく、既存のコードベースを発展させる必要があった。

すべてのモデルに同じプロンプトが与えられ、Claude Codeハーネス上で実行された。各チェックポイントでは新しいコンテキストウィンドウが使用された。評価者は、出来上がったプログラムまたはサービスに非公開のブラックボックステストを適用し、新しい動作と、それまでに引き継がれたすべての回帰テストの両方が成功した場合にのみ、厳格合格として数えた。この累積基準の下では、ある段階で持ち込まれた不具合は、修正されない限り、その後の合格も引き続き妨げた。

Opus 5は17チェックポイント中4つに合格し、報告上の合格率は24%だった。Opus 4.8とSonnet 5は、それぞれ1つ、率にして6%だった。Opus 5が成功したうち3つは、`circuit_eval`問題の冒頭のチェックポイントで、4つ目は最初の`database_migration`チェックポイントだった。他の2モデルも、このデータベース移行の最初の段階に合格した。

著者は、この実行の規模が限られていることを強調した。9通りのモデルと問題の組み合わせのうち、易とされた課題を含め、不具合のない実装で最終チェックポイントに到達したものは一つもなかった。したがって、この結果はベンチマーク全体における一般的な性能を確立するものではないが、段階的に開示されるソフトウェア要件に3つのシステムがどう対処したかを、統制された条件で示している。

SlopCodeBenchは、2026年3月に導入された長期的なコーディング能力を測るベンチマークだと説明された。完全な仕様を最初に提示するタスクとは異なり、各課題を一連の変更に分割している。リポジトリの投稿によると、元の論文の結果ではGPT-5.4の厳格合格率が11%、Opus 4.6が17%だったが、ベンチマーク全体についてのこれらの数値は、今回の3問題のサブセットと直接的には同等でない。

この試験では、決定論的なコード品質指標41項目も追跡した。抽出された実行過程では、要件が積み重なるにつれて、モデルの出力は冗長さと複雑さを増した。Opus 5が作成した関数または呼び出し可能オブジェクトの数はOpus 4.8の5倍だったが、テストを分離すると、本番コードの量は1.8倍程度に近かった。過度に冗長だと判定された行の割合は、全モデルを通じて、最初のチェックポイントの約65%から8番目までに約80%へ上昇した。

著者は、これらのルールが厳しすぎる可能性があり、保守性との関係も確立されていないと注意を促した。最も明確な結果は、より限定的なものだ。すなわち、この小規模な実行ではOpus 5が厳格合格数で首位だったものの、テストされたシステムのいずれも、人間の誘導なしに、変化するコードベースを確実に完成まで導くことはできなかった。