出来事の日付:2026年8月5日。 NeonとCastformは、事後学習を施した40億パラメータのオープンモデルが、コストをわずかな割合に抑えながら、フロンティアモデルと同等の検索精度を達成したという検索実験について説明した。この結果は、特定のエージェント型検索構成に関するものであり、モデルの知能全般を比較したものではない。
このプロジェクトは、Castformの強化学習による事後学習パイプラインと、NeonのPostgresプラットフォームに保持されたデータの検索を組み合わせている。その前提は、企業がすでにナレッジベースや業務用データベースに有用な訓練素材を保有している一方、それをタスク、正解、報酬へ変換するには通常、大がかりな準備が必要だというものだ。Castformはコーパスから質問回答タスクを生成し、反復的な訓練試行を管理する。
各試行では、エージェントは回答に十分な材料がそろうまでLakebase Searchを呼び出せる。報酬関数は、システムが正しい文章部分を取得したか、意図された出典を引用したか、正しい回答を返したかを採点する。続いて、そのスコアから得られたフィードバックが後続の試行を導く。開発者らによると、可観測性ツールによって、ユーザーは報酬の全体的な推移と個々の実行の両方を調べ、ツールの故障や報酬ハッキングといった問題を確認できる。
両社は、この取り組みを、一度きりの類似性検索から複数段階の検索への移行という文脈で位置付けている。エージェントは質問をより小さな検索に分解し、回答をまとめるまでに複数回モデルを呼び出す場合がある。これはプロセスを改善し得る一方、高価なモデルを繰り返し使用すれば、遅延とコストの両方が増える。プロジェクトの説明によると、比較対象となったフロンティアシステムを使用した代表的なマルチターン要求は、端から端まで10秒超を要し、約3セントの費用がかかった。
報告された100倍のコスト差は、この集中的なタスクに小規模なオープンモデルを使用する場合の経済性を反映している。40億パラメータモデルが、無関係なワークロード全般でフロンティアシステムに取って代わることを証明したと解釈すべきではない。公開された証拠は、社内で構築された訓練・評価パイプラインについて説明したものであり、提供資料には独立した追試結果は含まれていない。
Neonによると、同社のインフラは、数千件の並列訓練ロールアウトによって生じる突発的な負荷に対応でき、アイドル期間中は計算資源を削減できる。同社はまた、将来、状態を変更するエージェントを分離し、ある訓練試行が別の試行や本番データベースに影響を及ぼすのを防ぐ方法として、データベースのブランチ機能を挙げている。
組織にとって、これは最適化に関する問いを、あらゆる用途に使う単一のモデルを選ぶことから、どの領域なら専門化が訓練と運用の複雑さに見合うかを判断することへと変える。
この実証は、検索の各段階で汎用フロンティアモデルに料金を支払うことに代わる選択肢として、事後学習を提示している。その実用上の魅力は、チームが信頼できるタスクと報酬シグナルを定義できるか、また、サンプル環境を各チーム独自のデータ、検索パターン、品質要件に置き換えてもコスト削減効果が続くかどうかに左右される。



