出来事の日付:2026年9月6日。 OpenAI RoboCurveに掲載されたベンチマーク投稿によると、GPT-6 Astraは単純なロボットアーム操作では高い性能を示したが、より難しい精密作業では依然として停滞した。この比較では、以前のClaude Fable 5および5.1に関する報告で使われたものと同じ一対のYAMアーム、同じInspect Robotsエージェントポリシー、同じ2つの作業を使用した。作業は、赤いブロックを持ち上げてボウルに入れることと、青いパズルピースを持ち上げて対応する溝にはめ込むことだった。

ブロックをボウルに入れる作業では、Astraは20回中19回成功した。投稿によると、Claude Fable 5.1は20回中8回、Fable 5は20回中わずか1回だった。Astraは完了までの時間も短く、Fable 5.1が1試行当たり6.8分だったのに対し、2.5分だった。報告書が推定した1回当たりのコストも、2.12ドルに対して0.94ドルと低かった。ベンチマークによると、比較は交互に実施する盲検化されたペア方式で行われ、計時から思考による停止時間は除外された。

パズル作業では異なる結果となった。Astraは20回中2回、挿入に成功し、Fable 5.1と全く同じ成績だった。報告書によると、両モデルとも溝までは到達するが、最後の同じ段階で停滞した。推定コストはAstraが1回当たり1.36ドル、Fable 5.1が2.18ドルだった。この結果からは、ロボットの器用さが明確に飛躍したというより、ある種類の動作には優れている一方、より繊細な操作作業では、最後の位置合わせで依然として同じ問題に直面するモデルだとみられる。

評価方法も重要だ。投稿によると、各試行は到達した最も高い段階について人間が評価したため、失敗した場合でも、どこまで進んだかに応じて数えられた。グラフ上の大きな点は各条件の平均を表し、薄い点は個々の試行を示す。報告書はまた、Astraの出力トークン数が80%少なかったとしている。同等の性能を、モデルによるやり取りを減らして、潜在的には低コストで達成できるのであれば、これは運用上注目すべき違いだ。

とはいえ、このベンチマークの範囲は依然として狭い。単一のロボット構成による2つの作業の比較であり、このモデルが現実世界でロボット工学全般に対応できるようになったという主張ではない。この結果が示しているのは、最先端の言語モデルと確立されたロボットポリシーのラッパーを組み合わせても、作業の性質によって結果が大きく異なり得るということだ。簡単なブロック配置はほぼ解決済みに見える一方、精密な挿入はなお非常に不安定である。ロボット制御システムを開発するチームにとって、これが主に有用なのは、推論能力の向上が役立つ領域と、依然として高精度の動作制御に依存する領域との境界を、より明確に示すからだ。