発生日:2026年8月4日。 Earendilは、意図的に小さくしたデフォルトのツールセットと拡張システムを中心に構築されたコーディングエージェント用ハーネス「Pi」の利点を説明した。同社によると、Piは4つのツールで始まり、システムプロンプトとツール定義を合わせても1,000トークン未満に収まる。
この手法は、AIモデルを取り巻く指示と反復的なコンテキストを減らすことを目的としている。Piでは、多数のワークフロー機能をデフォルトで含める代わりに、ユーザーが自身のニーズに応じて機能を追加できる。Earendilはこれを「コンテキスト規律」と呼び、作業セットを小さくすればコストを下げ、タスクに必要なモデルの実行回数を減らせると主張している。
同社は、数百万行から成る自社コードベースを基にしたタスクでコーディングエージェントを検証したDatabricksの研究を挙げている。Earendilの要約によると、この研究は基盤モデルと、それを動作させるために使用するハーネスを分けて評価し、ハーネスによってコストと結果が大きく変わり得ることを示した。Earendilは、研究の「xhigh」設定でOpus 4.8と組み合わせたPiが、Claude CodeやCodexより大幅に低いコストで、全体として最高の合格率を達成したと報告している。
Earendilはまた、Databricksの研究では、同じモデルと思考労力を用いた一部の比較で、品質が変わらない場合でも、タスク当たりのコストに2倍を超える差が生じたことが分かったとしている。その説明によると、Piが1ターン当たりに送信したコンテキスト量は約3分の1だった。これらの数値は、Earendilが自社製品を支持する主張の中で提示したもので、提供された証拠によって独立に裏付けられたものではない。
第2の例は、Shopifyの拡張機能「pi-autoresearch」に関するものだ。Earendilはこれを、測定可能な実験を行い、性能低下を退け、改善を維持する自律的な最適化ループと説明している。同社によると、Shopifyは、ユニットテストが300倍高速化し、Reactコンポーネントのマウントが20%改善したほか、ビルド時間とpnpmの性能も改善した事例を報告したという。これらは報告された事例の結果であり、ほかのコードベースでも同様になることを保証するものではない。
Earendilにとってこの例は、最小限の構成から始めても、専門的な自動化が妨げられるわけではないことを示すものだ。Piは自身の拡張機能のドキュメントを調べてワークフローの作成を支援できるため、すべてのセッションに複雑さを組み込むのではなく、選択的に追加できる。同社は、コンテキストウィンドウが小さく、プロンプトのプリフィルが遅いため、安定したコンパクトなプレフィックスが特に有用になり得るローカルモデルについても、同様の主張をしている。
より広い主張は、コーディングエージェントの経済性はトークン単価だけでなく、実行全体に左右されるというものだ。高性能なモデルでも、ハーネスの支援によってより少ない手順で完了できれば安くなる可能性がある一方、軽量なモデルでもターンを繰り返す必要があれば高くつく可能性がある。Earendilの証拠は、Piをその原則の実装例の一つとして位置付けている。その利点がどの程度一貫して得られるかを立証するには、モデル、リポジトリ、タスクの種類を横断した独立比較が必要になる。



