出来事の日付:2026年9月18日。

OpenJevは、ローカルの言語モデルに選択範囲を限定した判断を求める2つの方法を比べる、操作可能なブラウザーデモを公開した。一つは許された選択肢に対するスコアを直接読み取る方法、もう一つは確率分布をJSONで生成するよう指示する方法だ。

この実験はWebGPUを通じ、利用者の端末上でオープンモデルを実行する。初期設定ではMiniCPM5 2Bが選ばれ、サイトはスマートフォンや低性能の機器にはQwen3 0.6Bを推奨する。より大きな40億パラメーターの選択肢もあるが、かなり多くのメモリーが必要だ。モデルの重みはHugging Faceからダウンロードしてブラウザーのキャッシュに保持し、サイトによれば、送信した入力は端末内にとどまる。

2つの評価経路には同じ判断課題を与える。直接方式では、ソフトウェアが指定された選択肢トークンのロジットを読み、その限定された集合の中で正規化する。生成方式では、モデルに推定分布をJSONで1トークンずつ出力するよう求める。両処理は同じGPUを奪い合わないよう、順番に実行される。

OpenJevは、直接出力は表示された選択肢を条件としたものだと注意を促す。校正された信頼度ではなく、モデルが本来好むかもしれないすべての回答を考慮するものでもない。固定されたメニュー内の相対スコアであるにもかかわらず、整った百分率を一般的な確実性の尺度として受け取る場合、この違いは重要になる。

ページにはブラウザーの性能計測用時計による測定値が表示される。設定、ウォームアップ、プロンプト準備、直接実行、最初の生成トークンまでの時間、生成全体の時間などだ。また、量子化は精度と速度の両方を変え得ると記している。デモはwllamaランタイムを通じてバージョンを固定したGGUFモデルのビルドを使うため、結果が表すのは元の全精度モデルではなく、ブラウザー向けにしたそれらの版である。

小規模な公開サブセットを使い、各事例を同じ重みで扱って2方式の一致を比較する。ページは直接判断の精度の列をバランス精度と表示し、ブラウザー向け量子化によって測定されるモデル品質が変わり得ると警告する。OpenJevは、どのローカルモデルの階層についても、公表済みのJevの結果に匹敵するとは主張していない。

この公開は、独立したベンチマークというより、手を動かして確かめる技術比較として捉えるのが適切だ。実用的な貢献は、試験をローカルに保ったまま、開発者が自分の機器で遅延や出力の違いを観察できることにある。また、モデルを既知の選択肢に点数を付けるものとして使うのか、それらの点数を説明するよう求めた文章生成器として使うのかという、アプリケーション内部に隠れがちな設計上の選択も見えるようにしている。