研究者らは、自律型AIエージェントが以前の探索記録を使って予行演習し、探索戦略を改善できるDream-RSIというシステムを提案した。この研究は、再帰的な改善における中心的な難しさに焦点を当てる。エージェントは解を生成して試せても、可能な経路が増えるにつれ、次にどこを探索するかの判断が高コストになり得るという問題だ。
ArXivに公開された論文は、探索の論理を基盤となるコーディングエージェントから分離する。軽量のオーケストレーション層が探索の判断を明示的でプログラム可能にし、基礎となるエージェント自体は変更しない。この設計によって研究者は、コーディングや問題解決を行うモデルを繰り返し再学習・修正せずに、システムが労力をどう配分するかを調整できる。
Dream-RSIの主要な仕組みは、過去の発見の木構造から作られた再生シミュレーターだ。この木構造は、エージェントが以前にたどった経路、検討した代替案、得られた結果を記録する。システムは、この蓄積された記録の中で修正した探索方策を評価できるため、変更を試すたびに新たな長期のオンライン実行の費用を払わず、素早いフィードバックを得られる。
シミュレーターが改善された方策を見つけると、オーケストレーション層はそれを新たな実環境での探索に投入する。その結果は、後の再生に使える履歴をさらに広げる。著者らはこの交互の過程を、自己改善のループと説明する。オンラインの作業が新しい証拠を生み、オフラインの予行演習がその証拠を使って探索を改良し、改良された方策が実環境に戻る。
この方法は二つの限界を避けることを狙う。固定の探索戦略は、小規模では機能しても、問題空間が拡大または変化すると適応できない場合がある。直接のオンライン最適化は適応できるが、長く高コストな一連の行動を終えてからしかフィードバックを得られないことがあり、探索方策そのものを探す作業まで重くなる。再生はより安価な中間的試験環境を提供するが、当然ながら、それまでに集めた履歴に含まれる経路に限定される。
論文は、アルゴリズム工学、数理最適化、GPUカーネル工学での実験を報告している。著者らによると、これらの領域でDream-RSIは、複数の条件において発見コストを削減しながら、競争力のある、または改善された発見の質を生み出した。提供された要約だけでは、あらゆる領域や処理負荷が同程度の恩恵を得るとは確認できない。そのため、結果は一般的な保証ではなく研究上の知見として読むべきだ。
この研究はまた、「再帰的自己改善」を特定の運用上の意味で使っている。Dream-RSIは、自分の能力全体を書き換えるモデルとして提示されているわけではない。変更しないコーディングエージェントの周りで、探索を導く方策を改善する。この限定的な枠づけによって、主張するフィードバックループが測定可能になる。システムは再生環境で方策を比較し、一つをオンラインへ再投入し、その後の発見の木構造が改善するかを観察できる。



