出来事の日付:2026年6月1日。 ある開発者が、2016年製Intel Xeon E5-2620 v4、128GBのDDR3メモリーを搭載し、グラフィックスプロセッサーを備えない再利用サーバー上で、Gemma 4の専門家混合モデルを稼働させる実演を行った。この成果は、古いハードウェアが最新のアクセラレーターに匹敵するという主張というより、特殊な推論設定によって、本来なら実用的でない構成をどのように利用可能にできるかを詳述したものだ。
このシステムでは、約252億パラメーターのGemma 4 26B-A4B検証モデルと、より小型のドラフトモデルを組み合わせている。検証モデルには128の専門家が含まれるが、各トークンについて有効化されるのは8つで、一度に稼働するパラメーターは約38億となる。この疎な構造によって計算量は減るものの、全ての重みをメモリーに収め、効率的にアクセスできるようにする必要は依然としてある。
著者によると、このマシンでのトークン生成は主としてメモリー帯域幅に制約される。デコード中、プロセッサーは比較的低速なDDR3メモリーからキャッシュへ向けて、モデルの重みを繰り返し転送する。次のデータが届く前に行列演算が終わる場合があり、演算ユニットは待機状態になる。そのため、サーバーにはモデルを保持できるだけの容量があるにもかかわらず、約10年前のCPUとメモリーではデフォルト設定が極めて低速になる。
この実験では、より多くの最適化制御機能を利用できることから、簡易的なモデル実行ツールではなく`ik_llama.cpp`を使用している。投機的デコーディングにより、小型モデルは最大3つのトークンを提案でき、大型の検証モデルはそれらをまとめて評価できる。著者は、これはCPUで特に有用だと主張する。キャッシュに収まるドラフトモデルの追加計算は、検証モデルの重みをメインメモリーから繰り返しストリーミングするよりコストが低いためだ。自動調整機能は、作業負荷に合わせて提案するシーケンス長を調整する。
ほかの設定はキャッシュ階層へ直接対処する。CPU向けの専門家混合オプションは専門家へのルーティング改善を図り、アップ射影とゲート射影を統合することで、本来なら別々のメモリー転送が必要となる処理を一つにまとめる。この処理では、共有帯域幅のボトルネックはワーカーを増やしても解消しないため、16の同時マルチスレッディング用スレッドを全て使うのではなく、マシンの8つの物理コアに合わせて8スレッドを使用する。実行時の再パッキングは、プロセッサーに適したキャッシュ配置に合わせて重み行列を再編成し、メモリーのロックはモデルデータがディスクへスワップされるのを防ぐことを意図している。
この報告は単一マシンでの実験であり、提供された資料には、速度、消費電力、品質について標準化された比較は示されていない。有用な知見の範囲はより限定的だ。十分なRAMがあるというだけでは、大規模モデルの推論が実用的かどうかは決まらない。モデルの疎性、投機的デコーディング、キャッシュの挙動、スレッド数、メモリー配置を組み合わせることで、古いサーバーハードウェアの有用寿命を延ばせる可能性があるが、一般的なツールが提供する以上の手動エンジニアリングが必要となる。
手動調整の多さも、この成果の一部である。この構成は、余っているサーバーを持つ実験者には適しているが、一般ユーザーがそのまま導入できる推奨構成としては不向きだ。再現するには、正確なプロセッサー、メモリーシステム、モデルファイル、推論ビルドに合わせてフラグを設定する必要がある。



