発生日:2026年7月28日

FermiSenseが公表した結果によると、強化学習でファインチューニングされた90億パラメータのオープンモデルが、カタログ審査タスクで複数のフロンティアモデル構成を上回った。同社はこの実験について、特定の業務ワークフローを採点可能にしたものを基に訓練すれば、小型の特化型モデルが汎用システムを上回り得ることを示す証拠だとしている。

報告されたテストでは、達成可能なカタログ審査の最高得点に対する比率として各システムを評価した。FermiSenseによると、同社の訓練済みモデルは、76.9%を記録した最良のフロンティアモデル構成を13.5%上回り、64.2%だった特化型モデル自身の未訓練時のベースラインを36%上回った。同社の説明によると、最適化されたプロンプトを使用した5つのフロンティアシステムは、互いに0.1ポイント以内の差で並んだ。

もう一つの大きな違いはコストだった。FermiSenseは、この特化型モデルの推論価格が審査対象リスティング1,000件当たり0.50ドルだったのに対し、最も高性能なフロンティアモデルのベースラインでは34ドルだったと報告している。同社によると、訓練済みシステムは、比較対象の中で最も低価格のフロンティアモデルよりもなお40倍安かった。1日当たり4,000万件の判断を行うと仮定した場合、記事は年間コストを特化型モデルで約700万ドル、最も高性能なフロンティアモデル構成で5億ドルと見積もっている。

これは一つのワークフローについて企業が公表した結果であり、独立した汎用ベンチマークではない。性能は、タスクの定義、採点プロセス、訓練データ、モデルの選択、導入時の前提条件に左右される。提供された証拠は、同じモデルが無関係な作業でも広範な能力を持つシステムを上回ることを立証していない。

FermiSenseは、この手法を反復可能な3段階のパターンとして説明している。オープンソースの基盤モデルを選び、実際のタスクから独自の事例を収集し、そのワークフローを採点できる評価器を使って強化学習を行うというものだ。これは、呼び出しのたびに企業固有の文脈を与えるため、プロンプトや検索だけに全面的に依存する方法とは異なる。代わりに組織は、繰り返されるタスクの挙動を特化型モデルに組み込む。

同社は、特化型モデルがあらゆる場面でフロンティアサービスに取って代わるべきだと主張しているわけではない。同社が提案するワークフローでは、まず汎用モデルを使って実現可能性を確認し、事例を生成する。プロセスの処理量が増えた段階で、事業者は社内データや手順への依存度が高い部分について、より安価な特化型モデルを訓練できる。タスクに異なる能力が必要な場合は、どちらのモデルも引き続きもう一方を呼び出せる。

この実験は、企業向けAIにおける具体的なトレードオフを示している。大規模な汎用システムは幅広い能力と迅速にプロトタイプを作る手段を提供する一方、小型モデルは範囲が狭く測定可能な判断に最適化できる。この手法を検討する組織にとって、報告された性能向上は評価設計の重要性を際立たせる。信頼できるタスクスコアがなければ、訓練報酬を設定するための健全な根拠も、特化型モデルが実運用のワークフローを本当に改善するかどうかを判断するための根拠も存在しない。