出来事の日付:2026年6月29日。 Qwen3.6 27Bの実機評価は、この稠密なオープンウェイトモデルがローカルでのソフトウェア開発に有用なバランスに達したと論じている。ただし、報告された環境では、一般消費者向けとしては異例に高性能なハードウェアが使われていた。Quesmaブログのテストでは、270億パラメーターのモデルを、Qwen3.6の35B A3B混合エキスパート型バリアントや、ローカルで実行可能な他のモデルと比較した。
評価者はllama.cpp、8ビットのGGUF量子化、マルチトークン予測を使用した。投稿によると、128GBのユニファイドメモリを搭載したMacBook M5 Max上で、モデルは毎秒約30トークンを生成し、GPU使用率は約95%に達した。Qwen3.6の両バリアントは、Appleシリコンの48GB共有メモリ内に収まった。4ビット版は18GB未満を占有するとされ、32GBのマシンも実行候補になり得るが、精度を下げると、サイズや速度と引き換えに品質が低下する可能性がある。
定性的な試験では、27Bモデルは1つのプロンプトから、要求されたNodeのパッケージ構造を含む、動作する六角形のマインスイーパー・プロジェクトを生成した。より高速な35B A3Bバリアントは、代わりに単一のHTMLファイルを作成し、そのパッケージ化の指示を満たさなかった。別のプロンプトでは、レスポンシブなランディングページを生成した。これらの例は特定のタスクにおける能力を示すものであり、一般的なコーディング品質を統制された条件で測定したものではない。
著者は、手作業で確認した際に出力が優れているように見えたため、より低速な稠密モデルを好んだ。報告された比較では、混合エキスパート型モデルは約3倍の速度で動作した。このトレードオフは対話的な開発において重要だ。生成速度はツールが実用的に感じられるかどうかを左右する一方、要件への適合度はその後に必要となる修正の量を決める。
投稿では、異なるハードウェア向けの選択肢についても説明している。積極的な量子化により、一般消費者向けのNvidia製カードでもモデルを実行できる可能性がある。引用されたユーザー報告では、RTX 5090上で6ビットモデルと12万3,000トークンのコンテキストを使用し、32GBのVRAMのうち約28GBを消費しながら毎秒50トークンを達成したと主張している。この数値はブログに掲載された第三者の結果であり、独立して再現されたベンチマークではない。
ローカル実行では、コードとプロンプトをユーザーのマシン内に保持でき、ホスティング型サービスにアクセスを依存しないため、プライバシーと可用性の面で実用的な利点がある。一方で、モデルのダウンロード、メモリ要件、発熱、電力消費などのコストと運用作業は開発者側に移る。Quesmaの結果は、Qwen3.6 27Bが十分な装備を持つマシン向けの有力な選択肢であることを裏付けるが、デバイス、作業負荷、競合モデルを問わない普遍的な「最適点」であることを証明するものではない。導入を検討する開発者は、自身のリポジトリ、コンテキスト長、エージェントツールでもテストする必要がある。1つのプロンプトで成功したデモからは、長時間の編集セッションにおける信頼性は分からない。そうしたセッションでは、蓄積されたコンテキスト、ビルドからのフィードバック、繰り返されるツール呼び出しによって、速度と出力品質の両方が変化する可能性がある。



