2026年8月16日に公表された分析によると、人工知能モデルは、重みの中に保持する詳細な事実知識を減らす一方で、構造化された推論能力を向上させている。開発者のワルター・ファン・デル・ギーセンは、これは意図的で潜在的に有用なトレードオフだと論じている。手順はより小さなモデルに圧縮でき、事実は必要なときに検索、文書、その他のツールを通じて提供できるという。

この論考は、数学的な成績と、支援なしでの想起能力を対比している。GLM-5.2はトークン当たり約400億パラメーターを稼働させながらAIME 2026で99.2%を記録し、Qwen3.5は稼働パラメーター170億で91.3%を記録、DeepSeek V4-Flashは稼働パラメーター130億で動作したと報告している。これらの数値は、論考で参照されたベンチマーク情報源に基づき著者が提示したもので、提供された証拠の中では独立した検証は行われていない。

事実知識のベンチマークは異なる傾向を示している。論考によると、SimpleQAではGemini 2.5 Proが53%で首位となった一方、Artificial Analysisは、40億および90億パラメーターのQwen3.5モデルについて、同社の知識テストで80~82%のハルシネーション率を測定した。著者は、小型モデルは数学やコーディングに利用できる再使用可能な手法を学習できる一方、人名、日付、ソフトウェアのバージョン、その他の事実からなる膨大なロングテールを保存する必要はないと解釈している。

この区別が重要なのは、保存された知識が古くなるからだ。価格、雇用状況、ライブラリー、製品インターフェースは、長期の訓練サイクルが終了する前に変わる可能性がある。代数的手法や、分解、作業の検算、バックトラッキングといった技法は、より安定している。したがって、最新の事実をモデルの重みの外に移すことで、高コストの訓練済みシステムと、日々変化する情報を切り離せる可能性がある。

このAI利用モデルでは、周囲のハーネスが不可欠になる。コーディングエージェントは、訓練時に記憶したAPIのバージョンに依存するのではなく、インストール済みの依存関係を調べ、文書を検索し、ファイルを読むことができる。検索・取得を利用すれば、事実の想起はモデルを呼び出すたびに発生するコストではなく、ユーザーの実際の環境に根差したオンデマンドの処理になる。また、エラーを検査・修正可能な文書にひも付けられるようにもなる。

外部知識を利用しても、ハルシネーションがなくなるわけではない。モデルが情報源を誤解したり、資料を誤って組み合わせたりする可能性があり、ツールを使わない要求に対しては依然として自信に満ちた誤答を返すことがある。この論考は、適切に設計されたシステムは、代わりに不確実性を認めて証拠を取得すべきだと主張している。この挙動はモデルだけでなく、ハーネス、指示、アクセス可能な情報にも左右される。

著者は、強力な推論能力を持ち、総パラメーター数が稼働パラメーター数に近いモデルは、特に4ビット量子化を使えば、最終的に一般消費者向けGPU上で動作できるようになる可能性があると予測している。これは実証された成果ではなく、依然として予測にすぎない。現時点の証拠が裏づけるのは、より限定的な結論である。すなわち、ベンチマーク上の効率は向上しているものの、推論スコアだけでは、モデルが広範で信頼できる事実想起能力を備えていることは示せない。