過去の出来事の日付:2026年8月28日。

研究者主導の取り組みが、教科書的な問題ではなく実務的な科学研究をAIエージェントがどの程度こなせるかを測定するため、継続的に更新されるベンチマーク「Terminal-Bench-Science 0.1」を公開した。最初のリリースには、生命科学、物理科学、地球科学、数理科学、工学の70のタスクが収録されている。

プロジェクトはスタンフォード大学の研究者が主導し、Terminal-Benchを開発したチームが、複数の分野と機関の専門家とともに構築した。タスクは、データ分析、統計的推論、シミュレーション、最適化、定理証明、画像再構成、信号処理、センサー較正、モデルフィッティングなどの作業を対象とする。エージェントは現実的なコンピューティング環境で評価され、その出力はタスク固有の再現可能なテストによって検証される。出力には、分析、証明、シミュレーション、コード、データ成果物などが含まれ得る。

初回の結果は、現在のシステムにとってこのベンチマークが依然として難しいことを示している。各モデルには、すべてのタスクについて独立した3回の試行機会が与えられた。Claude Codeと組み合わせたClaude Opus 5が、解決率30.0%で首位となった。Codexと組み合わせたGPT-5.6 Solが22.4%で続き、Claude Codeと組み合わせたClaude Fable 5は21.4%だった。Claude Opus 4.8は10.5%で、GPT-5.6 Terra、Kimi K3、Grok 4.6はいずれも10%未満に終わった。オープンモデルで最高得点だったのはGLM 5.3の8.1%で、GPT-5.6 Lunaは3.3%を記録した。

成績は分野によって異なった。Claude Opus 5は、数理科学を除くすべての分野で、得点上位3システムのうち他の2システムを上回った。数理科学では、Claude Fable 5が33.3%、GPT-5.6 Solが31.4%を記録した。工学分野では、Grok 4.6が14.8%でGPT-5.6 Solと同率2位となり、評価では、より少ないトークンを使用し、コストも低かった。

プロジェクトはリソース使用量も追跡している。ベンチマークによると、全タスクでClaude Opus 5を評価するのに7,000ドルかかった。GPT-5.6 Solの費用は4,200ドルで、実行費用が1万4,200ドルだったClaude Fable 5と同程度の解決率を達成した。後者は64億トークンを使用したのに対し、GPT-5.6 Solは84億トークンを使用した。コストとトークンの両方のパレートフロンティアに入ったのは、Kimi K3とClaude Opus 5だけだった。

タスクセットの作成には大規模な選別が伴った。貢献者から920件の提案が提出され、464件が実装を承認され、386件がプルリクエストになったが、査読者がバージョン0.1向けに採用したのは70件だった。分野別の査読者が科学的妥当性を評価し、技術査読者が構築方法と検証手法を精査し、最終査読者が品質を確認した。

主催者はこのベンチマークを、一度限りのリリースではなく継続的な仕組みだと説明している。科学者は公開されたプロセスを通じて新たなワークフローを提案し、既存のタスクを改善できるため、エージェントの能力が進歩するにつれて将来のバージョンも変化し得る。初期スコアは、要求水準の高い研究ワークフローの信頼できる自動化が依然として限定的であることを示す一方、進歩を比較するための測定可能な基準を提供している。リリースを重ねることで、進歩が分野横断的に波及するのか、それとも特定の種類の科学研究に集中したままなのかも示せる可能性がある。