OpenAIのカスタム推論チップ「Jalapeño」の技術的詳細が、Hot Chipsでの発表と半導体調査機関SemiAnalysisによる評価を受け、2026年8月25日ごろに一段と明らかになった。このプロセッサーは、学習ではなく大規模言語モデルの推論用に構築された特定用途向け集積回路で、Broadcomと共同開発された。

SemiAnalysisによると、設計作業は2024年半ばに始まり、約16カ月で製造用テープアウトに到達した。同社はJalapeñoについて、OpenAI独自のモデルに限定されたハードウェアではなく、汎用の推論プロセッサーだと位置付けた。同社はOpenAIの研究所を訪れ、このチップ上で自社のInferenceXベンチマークのほか、DeepSeek R1、Kimi-K2.5、GPT-OSSを含むオープンモデルが動作するのを確認したという。

初期結果は、電力単位当たりの出力に大きく焦点を当てている。SemiAnalysisの報告によると、Jalapeñoは、低遅延と高スループットの両方の設定を含む、測定された条件の大半で、1メガワット当たりのトークンスループットがほかの試験対象システムを上回った。並行数1の場合、DeepSeek R1はユーザー1人当たり毎秒700トークンを超え、Kimi-K2.5とGPT-OSSはユーザー1人当たり毎秒約1,400トークンで動作したという。試験した構成では、マルチトークン予測や投機的デコーディングではなく、シングルトークン予測を使用した。報告はまた、GSM8kの評価結果がNvidia製ハードウェアと同等だったとしている。

これらの数値には重大な留保がある。SemiAnalysisによると、同社のアナリストはInferenceXの実行を一部現地で目撃したものの、すべての性能数値はOpenAIが提供した。同社はInferenceXの全試験一式を実行しておらず、より長いコンテキストと複数ターンを伴う本番ワークロード向けに同社が推奨するベンチマーク、AgentXの結果も確認していなかった。このようなワークロードでは、短い試験では捉えられない可能性のある、ルーティング、プレフィックスキャッシュ、メモリ管理、オフロードに関する制約が明らかになることがある。

NvidiaのBlackwell世代との比較も完全ではない。JalapeñoはHBM4メモリを使用し、依然としてエンジニアリングサンプルの段階にある一方、SemiAnalysisによると、Nvidiaのより新しいVera Rubinシステムは顧客への提供が始まりつつあった。同社は、同じくHBM4を使用するRubinの方が、より適切な競合製品だと主張した。さらに、ほかのベンダーはJalapeñoで実演されたものより新しく大規模なモデルでの試験結果を公表していると指摘した。

電力を重視する背景には、実際の導入上の制約がある。追加のアクセラレーターを発注できるようになった後も、電力会社との接続、冷却システム、非常用発電設備によって、データセンターで利用可能なメガワット数が制限される可能性がある。そうした環境では、1ジュール当たりの生成トークン数が、一定規模の施設で対応できる推論量に直接影響し得る。

OpenAIの設計上の優先事項は、チップの取得費用や設置面積だけでなく、データセンターの電力制限を反映したワット当たり性能にあるとみられる。一定の電力枠内でトークン出力を増やせれば、追加の送電網接続や冷却インフラを待つことなく、サービス提供能力を高められる可能性がある。それでも、現段階で入手可能な証拠は、目撃されたものの不完全なベンチマーク試験であり、独立した包括的評価ではない。量産版の提供時期、より幅広いモデルでの性能、Rubinとの直接比較は未解決のままだ。