出来事の日付:2026年8月3日。 Qwen Teamは、新たな旗艦人工知能モデルQwen3.8-Maxを発表した。同社によると、このモデルは2.4兆個のパラメーターを持ち、所定のワークロードでは950億個を活性化する。同社はQwenCloudを通じてモデルを提供開始し、翌週にウェイトを公開する予定だと述べた。
発表では、Qwen3.8-MaxはQwenファミリーで最も高性能なモデルであり、Max規模では初のオープンウェイト版と説明された。同システムはQwen3.5アーキテクチャの拡張版と位置付けられ、ソフトウェア開発、研究、職場での作業、マルチモーダルな運用、長期間継続するプロジェクトを対象に改良が施されている。こうした性能に関する記述とテスト結果はQwen自身のリリース資料に基づくもので、提供された証拠の範囲では独立した検証を受けていない。
Qwenは、自律的なコーディングの実演を複数紹介した。そのうちの一つでは、モデルが自己進化型のコマンドラインプロジェクトに約16日間取り組み、7月30日までに265件のコミット、127件のプルリクエスト、151件のイシューを作成したという。別の例では、データ選択に関する論文の実験を再現するために約125時間を費やした後、18件の改善案をテストしたとされる。Qwenによると、その結果得られた手法は、数学ベンチマークAIME24において、論文の手法を2.7ポイント上回った。
同社はまた、526の人間のチームが参加するマルチモーダル対話意図コンテストにモデルを出場させた。Qwenによると、同システムは24時間以内に45件を提出し、正解率0.853を記録して458チームを上回った。これらの例は、一度きりのコード生成ではなく、テストやリーダーボードからのフィードバックを活用した反復的な作業を示すものとして提示された。
コーディング以外についても、Qwenは、QwenWork、Claude Code、Codex、OpenClaw、Hermesを含む複数のエージェントハーネス上で、ツールを多用する業務ワークフロー向けにモデルを訓練したと述べた。公開されたベンチマーク表では、Terminal Bench 2.1で86.6、SWE-bench Proで67.7、社内ベンチマークCoWorkBenchで74.8というスコアが報告された。リリースには詳細な評価注記が含まれるが、一部のベンチマークは社内用であり、テスト構成もモデルごとに異なるため、単純な比較には限界がある。
QwenCloudは、OpenAIのチャット補完およびレスポンス仕様と互換性のあるインターフェースに加え、Anthropic互換APIを通じてQwen3.8-Maxを提供する。このモデルは、low、medium、xhighの各レベルで推論量を調整でき、xhighがデフォルトに設定されている。Qwenは複数のコーディングアシスタント向けの統合手順も公開した。その例では、テキストと画像の入力、および対応する統合環境での100万トークンのコンテキストウィンドウが挙げられている。
したがって、今回の即時提供は、将来のオープンウェイト化の約束を伴うホスティングサービスとしてのリリースである。予告されたファイルが実際に公開され、外部の評価者が結果を再現するまでは、最も広範な能力に関する主張はベンダー側の主張にとどまる。それでも、その仕様と実演からは、Qwenが従来型の質問応答と同程度に、長時間継続するエージェント作業を重視していることが分かる。



