ある開発者が、14日間の最適化コンテストでコーディングエージェントを自動研究ループに組み込んだ結果、基準となるGPUカーネルと比べて232倍の高速化を達成したと報告した。2026年8月15日に取り上げられた記録によると、この参加者はCore Automationと共同で開催されたGPU Modeのコンテストで、参加者183人中12位になったという。
課題は、FP32 CUDA行列を対象とする、正方行列のバッチ処理によるコンパクト・ハウスホルダーQR分解だった。提出物は、PyTorchの`torch.geqrf`と同じコンパクト表現、すなわち上三角部分に上三角因子R、下側部分にハウスホルダーベクトルを格納した行列と、tauと呼ばれる反射係数のベクトルを返す必要があった。チェッカーはQを再構築し、Rを抽出したうえで、それらの因子が入力を正確に再構成できるかを検証した。
正しい提出物は、行列形状と条件設定の各ケースにおける実行時間の幾何平均によって順位付けされた。重要な次元には、512×512行列のバッチのほか、より大きな1,024、2,048、4,096のケースが含まれた。内部では低精度形式を使用できたが、返される因子はFP32のQR結果向けに設計された検査を満たす必要があった。このため、必要な数値精度を単に切り捨てるだけでは高速化できなかった。
コンテストのコマンドライン・ツールにより、エージェントはテスト、ベンチマーク、提出を直接行うことができ、形状ごとの性能情報と総合スコアが返された。これにより、著者の実験を支える緊密なフィードバックループが形成された。参加者は2週間で1,500回を超える提出を行ったが、多数の利用者が短時間に集中して利用したため、待ち行列が長くなったり、ホスト型コンピューティングのクレジットを使い果たしたりすることもあった。
コンテスト以前、著者にはGPUカーネル最適化に約1年間触れてきた経験があったものの、この分野で専門職として働いた経験はなかった。初期の作業には、AIの支援や教育動画を使ってQR分解とハウスホルダー反射を学ぶことも含まれていた。最終的なアーキテクチャでは、ブロック化されたハウスホルダー演算と後続部分へのWY更新を採用した。これは、逐次的な分解問題をGPU上の行列乗算により適した処理へ変換することを意図した手法だった。
この記録では、このプロセスを「自動研究」と呼ぶ一方、他の人々は「ループ・エンジニアリング」と呼ぶかもしれないことも認めている。その中心的な主張は、エージェントが解決策のすべてを独力で発見したというものではない。分野の知識があったことで、参加者はより適切な質問をし、有用な用語を認識し、提案された手法を評価できた。同時に、決定論的な正確性テストとベンチマークのフィードバックにより、エージェントにはコードを修正するための具体的なシグナルが与えられた。
報告された232倍の改善はコンテストのベースラインとの比較であり、実運用向けQRライブラリ全般との普遍的な比較ではない。これは参加者自身の結果とリーダーボードに関する説明に基づいており、提示された証拠には独立した再現結果はない。それでも、この実験は、エージェント支援による最適化の具体的なパターンを示している。すなわち、出力を厳密に制約し、評価を自動化し、詳細なフィードバックを返し、何度も反復するというものだ。また、この順位は、ベースラインを大幅に上回っても、競争の激しい分野では必ずしもトップ10入りできるとは限らないことも示している。



