ベンチマークの掲載結果は、複数の推論レベルにおける精度と1タスク当たりのコストの双方を重視している。これが、2026年8月7日付の証拠における中心的な点である。DeepSeek V4 FlashはARC-AGIテストで低コストの成績を記録した。

最大努力の設定では、このモデルは準非公開のARC-AGI-1セットで1タスク当たり0.02ドル、89.0%を記録し、対応するARC-AGI-2セットでは1タスク当たり0.04ドル、61.4%を記録した。

この記事は、このテーマが注目を集めた理由についても説明している。DeepSeek V4 Flash 0731はARC-AGI-1、ARC-AGI-2、ARC-AGI-3で評価され、各推論設定について合格または不合格の結果が報告された。普遍的な結論を示唆するのではなく、詳細は、ある一つの機関、プロジェクト、または著者が、明確に定義された問題にどのように取り組んでいるかを示している。

ARC Prizeの結果によると、高推論努力の設定では、1タスク当たりわずか数セントでARC-AGI-1 Semi-Privateの89.0%、ARC-AGI-2 Semi-Privateの61.4%に到達した。

この記事には、提供されたarcprize.orgの資料のみを使用した。したがって、文言は出典を明示したまま、文書で確認された事例を超えて主張を拡張しないようにしている。提案された能力を実際に測定された導入実績と、著者の主張を合意された見解と、また裁判所命令をあらゆる法的手続きの終結と混同しないことが特に重要である。

こうした制約があっても、この証拠は有用なスナップショットを提供する。関係する主体、示された根拠、その時点で利用可能だった測定可能な要素を特定している。次の試金石は、対象に応じて、実施、反応、またはさらなる精査から生じる。それまでは、ここで裏付けられた限定的な説明が最も妥当である。

情報源一式は、報道上の明確な境界も示している。正確な主張は出典を明示して繰り返せる一方、存在しない技術的、法的、比較上の詳細を責任をもって再構成することはできない。この区別は、その項目を本来の条件に即して評価し、利用可能な記録で裏付けられない結論を避けるうえで重要である。

情報源一式は、報道上の明確な境界も示している。正確な主張は出典を明示して繰り返せる一方、存在しない技術的、法的、比較上の詳細を責任をもって再構成することはできない。この区別は、その項目を本来の条件に即して評価し、利用可能な記録で裏付けられない結論を避けるうえで重要である。