イベント日:2026年9月10日

ある独立系開発者が、38億パラメーターの言語モデルをランダム初期化から998ドルで訓練したと報告し、大手AI研究所の外でも有意義な事前学習実験を行えるようになりつつある証拠として、このプロジェクトを提示した。

開発者の技術報告によると、モデルは650億トークンを処理し、CORE評価スイートで0.384のスコアを記録した。一連の実行には43時間を要し、それに先立つ開発とデバッグにはGeForce RTX 5090、最終訓練にはレンタルしたNvidia B200アクセラレーターを使用した。この数値は自己申告であり、独立して再現されたベンチマークではなく、1つのプロジェクトにおけるエンジニアリング上の結果として読むべきだ。

このモデルは、RMSNorm、ロータリー位置埋め込み、グループ化クエリアテンションなど、現代的なコンポーネントを備えたデコーダー専用のLlama形式アーキテクチャを使用している。little-lmと呼ばれる訓練システムはYAMLファイルで設定され、メインの訓練コードを書き換えることなく、データセット、オプティマイザー、スケジュール、コールバックを交換できる。著者は、このモジュール性によって失敗した実験の原因を診断するサイクルが短縮されたと主張している。

より小規模なベースラインは、その反復作業が重要だった理由を示した。以前の8億5,800万パラメーターモデルは、FineWeb-Eduを使用し、1基のA100で5.8日間訓練されたものの、PIQAのスコアは60.45%で、はるかに小さいGPT-2モデルについて引用された約63%という結果を下回った。生成された文章も反復的で、頻繁に一貫性を欠くと評された。

最終的な訓練手法では、学習率スケジュールを変更し、最適化処理をMuonとAdamWに分担させ、データセットをClimbMixへ変更し、FP8行列演算を使用するとともに、Tensor Coreの効率を高めるため語彙をパディングした。また、訓練コンテキストを2,048トークンから1,024トークンへ短縮し、利用可能なメモリ内でより大きなバッチを使用できるようにした。2,048トークンで再度実行したところ、報告された0.384のスコアが得られ、著者はコンテキストに左右されるタスクが差の大部分を説明していると述べた。

定常状態の訓練中、システムは毎秒約48万トークンを処理したと報告されている。CORE評価によって大幅なオーバーヘッドが加わった一方、GPUでは高いストリーミングマルチプロセッサー稼働率が記録された。このプロジェクトでは、シャーディング型オプティマイザーではなく、通常のDistributedDataParallelを使用した。このモデル規模かつ単一ノードでは、勾配通信がボトルネックではなかったためだ。

RTX 5090を使用したテストからは、複数のローカル最適化手法も見いだされた。FP8演算、語彙のパディング、融合型の線形クロスエントロピー実装は、ステップごとの挙動とメモリ消費を引き換えに、全体的なスループットを向上させた。この報告は、個別処理で最速のものを選ぶことより、訓練全体の進行を最適化することの方が重要だと強調している。

この実験はフロンティアモデルの規模には及ばず、結果は選択されたデータと評価方法に左右される。それでも、チュートリアル規模のモデルと、組織レベルの予算が必要な訓練実行との間に広がりつつある中間領域を探る研究者に対し、コストと性能に関する詳細なデータポイントを提供している。