発表日:2026年4月4日。 研究チームは、同じモデルが生成した解答でファインチューニングすることにより、コード生成言語モデルを改善する簡素な手法を発表した。arXivで公開された論文によると、「シンプルな自己蒸留」と呼ばれるこの手法には、より強力な教師モデルも外部の検証器も必要ない。

この手順ではまず、選択した温度および切り詰めの設定の下で、モデルからプログラミングの解答をサンプリングする。それらの未加工の出力を、通常の教師ありファインチューニング用の訓練データとして使用する。候補となる回答を採点したり、実行時のフィードバックを使ったり、強化学習を通じて最適化したりする事後学習システムとは対照的に、提案手法はモデル自身の生成分布に依存する。

研究者らが報告した主な結果では、Qwen3-30B-InstructのLiveCodeBenchバージョン6におけるpass@1が42.4%から55.3%に向上した。Pass@1は、モデルが最初に生成した解答がベンチマーク問題で成功する頻度を測る指標だ。著者らによると、最も大きな改善は難度の高い課題で見られ、この手法が、モデルがすでに安定して生成できていた回答を単に強化しただけではないことが示唆された。

論文では、40億、80億、300億パラメーター規模のQwenおよびLlamaの各モデルファミリーでも性能向上が報告されている。指示チューニング型と推論重視型の両方の派生モデルが含まれた。この幅広さは重要だ。そうでなければ、自己蒸留の効果を、特定のモデル、規模、デコーディング設定の特性から切り分けるのが難しくなり得るためだ。この結果は依然として論文上の研究主張であり、ほかのシステムや実際の開発作業にどの程度一貫して適用できるかを確立するには、独立した追試が必要となる。

この改善を説明するため、研究者らは、デコーディング中に精度と探索の間で生じる対立を挙げている。コード生成では局所的に厳密な選択が求められることが多い一方、難問を解く際には、複数のもっともらしい経路を維持することが有効な場合もある。研究者らの分析は、慎重にサンプリングした自己生成解答でファインチューニングすると、文脈に応じてトークンの確率が異なる形で変化することを示唆している。正確な選択が重要な箇所では、可能性の低い妨害要素が減る一方、探索が役立つ解答部分では有用な多様性が維持される。

この研究は、シンプルな自己蒸留を、評価の万能な代替手段ではなく、補完的な事後学習技術と位置付けている。生成されたコードをテストする必要性がなくなるわけではなく、提示された要旨では、実運用のリポジトリ、セキュリティー上重要な課題、あるいはベンチマークの対象外の言語における性能は実証されていない。それでも、報告された大幅な向上は、別のシステムによるラベルがなくても、モデルのフィルタリングされていない出力に訓練シグナルが含まれ得ることを示す証拠となっている。

著者らは、論文からリンクされた公開リポジトリを通じてプロジェクトのコードを公開しており、ほかの研究者が実装を検証し、異なるデータ、サンプリング、モデルの条件でこの手法を試せるようにしている。

訓練サンプルは外部で検証されていないため、サンプリング方法が主張の中核をなす。この研究では、すべてのモデル出力を同じように有用とみなすのではなく、温度と切り詰めを具体的に変化させている。