出来事の日付:2026年9月18日。

ByteShapeは、Qwen 3.8 27Bを量子化したモデルのShapeLearn完全版を公開した。以前のLite版を拡張し、精度、サイズ、推論速度の異なる均衡を狙う5種類のGGUF版を用意した。同社によると、試験では5モデルすべてが測定上の品質と速度のフロンティアに位置し、図に示した他のどの構成も、それらを速度と精度の両方で上回らなかったという。

この公開は、270億パラメーターの密なモデルをローカルGPUで動かしたい利用者を対象とする。ByteShapeは、メモリーに余裕があればGPU-5版を推奨し、総合ベンチマーク結果はBF16基準版の99.63%に相当すると報告する。小型のGPU-4モデルも99%近くを維持しながら、コンテキストと実行時バッファー用の余地を多く残す。同社は、モデルがカードの公称メモリー容量に収まることは、あらゆるコンテキスト長や提供環境が収まる保証にはならないと注意を促す。

試験は6種類のNvidia GPUで行われた。RTX Pro 6000では、ByteShapeはGPU-5の速度を毎秒90.4トークンと測定した。同版はRTX 5090で毎秒93.7トークン、RTX 4090で45.8トークンに達した。4090上ではGPU-4の方が速く、毎秒49.5トークンで、報告された総合得点の低下は1パーセントポイント未満だった。メモリーの余裕が少ないRTX 4080とRTX 5060 Tiのシステムでは、GPU-4はそれぞれ毎秒52.4トークンと33.1トークン、GPU-5は45.7トークンと29.1トークンだった。

これらの数値はByteShape自身の評価に基づき、独立した検証ではなくベンダーのベンチマークとして読む必要がある。比較にはAtomicChat、ISTA-DASLab、Prism-ML、Unslothなどのモデルが含まれた。ただしByteShapeは、Bartowskiの新しい公開版は試験後に登場したため除外したと記している。Prism-MLの最小のTernary Bonsai 2版は図中で最速だったが、総合得点は低く、独自のランタイムビルドが必要だった。

ByteShapeは投機的デコーディングも試した。すべてのGGUFにMTPのドラフトヘッドが付属する一方、DFlash2は別の1.1 GBのドラフトモデルを使い、llama.cppのビルド10658以降を必要とする。製品群全体で、同社が測定した次トークン生成のスループットは、DFlash2が基準の1.34~2.10倍、MTPが1.28~1.66倍だった。

完全版は、8月にQwen 3.8 27Bが登場した直後、より少ない最適化予算でByteShapeが作ったShapeLearn-Liteに続くものだ。新たな結果は、モデル圧縮における一つの違いも浮き彫りにする。BF16基準版からの分布の乖離が小さくても、それが必ずしも課題の成績向上につながるとは限らない。同社は、スループットと総合ベンチマーク結果を組み合わせて順位付けし、ローカルモデルの利用者が、ファイルサイズ、利用可能なコンテキスト、応答速度の間で選択するための、より実用的な根拠を提供すると述べている。