出来事の日付:2026年7月31日

DeepSeek V4 Flash 0731は、Artificial Analysisによる評価で、比較的高性能なオープンウェイト推論モデルの一つに位置付けられた。総合知能スコアが高く、出力も高速だった一方、比較対象グループの中央値を大幅に上回るトークンを生成した。

7月31日にリリースされた同モデルは、Artificial Analysis Intelligence Indexのバージョン4.1.1で52点を記録した。評価機関によると、同等モデルの中央値は28だった。この指数は、実用的な分析作業、科学コーディング、難度の高い一般的な質問、知識の信頼性、長いコンテキストでの推論を対象とする一連のテスト結果を組み合わせたものだ。

Artificial Analysisの報告によると、同モデルの出力速度は毎秒119トークンで、同社はこれを著しく高速だと評した。テキスト入力とテキスト出力に対応し、100万トークンのコンテキストウィンドウを備える。この規模のコンテキストウィンドウは、長い文書や検索・取得した資料を単一のリクエストに収めるワークフローを支えられるが、最大入力容量だけでは、モデルが資料のすべての部分をどの程度確実に活用できるかは分からない。

この評価では、冗長性がトレードオフになることも明らかになった。DeepSeek V4 Flash 0731はIntelligence Indexの実行を完了するまでに約2億1,000万トークンを生成したのに対し、同クラスの中央値は1億1,000万トークンだった。プロバイダーのトークン単価に競争力があっても、推論過程や回答が長ければ、遅延やタスクの総費用に影響する可能性がある。

表示価格は、入力100万トークン当たり44セント、出力100万トークン当たり1.32ドルだった。Artificial Analysisは、それぞれの料金について、比較対象の中央値である30セントと1.17ドルをやや上回ると説明した。Intelligence Indexの全実行費用は323.26ドルで、これには料金と同モデルの多い出力量の両方が反映されている。

報告されたスコアは、普遍的な順位ではなく、この評価機関の手法の枠内で解釈すべきだ。バージョン4.1.1は、GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCRを組み合わせている。実運用の用途が異なれば、これらの構成要素の重要度も異なり得る。コーディング支援、文書分析ツール、顧客向けチャットボットでは、それぞれ精度、速度、回答拒否の挙動、コンテキスト長、簡潔さに異なる価値を置く可能性がある。

Artificial Analysisはまた、速度の数値について、ファーストパーティーのインターフェースが存在する場合はそれを使用し、存在しないモデルでは複数プロバイダーの中央値を使用していると述べている。したがって、実環境でのスループットは、ホスティング、負荷、プロンプトのサイズ、導入構成によって変動し得る。

提示された証拠に基づけば、DeepSeek V4 Flash 0731の主な訴求点は、生成速度を犠牲にせずに高い知能評価を得たことだ。だが、異例に多いトークン消費量がその構図を複雑にしている。モデルを比較するチームは、表示価格やベンチマーク上の順位だけでなく、完了したタスク当たりのコストと回答効率も考慮する必要がある。ここで評価された推論設定は、遅延に敏感なアプリケーションで使われる、より軽量な推論設定とは異なる可能性もある。