Kevというオープンソースプロジェクトが、Qwen3.5を基盤とする小型の判断モデル群を公開した。開発者がローカルで動かし、選択式、採点、検証の問いに対して確率を割り当てるシステムだ。プロジェクトは学習済みアダプター、学習コード、TypeSafeのSystem Oneと同じAPI形式で動作するよう設計したサーバーを提供する。
Kevには8億、40億、90億パラメーターのモデルがある。リポジトリーでは、まず試すモデルとして4B、メモリー使用量より確率の較正や精度を重視する場合に9B、最小の占有量を求める場合に0.8Bを推奨している。サーバーは標準設定ではローカルマシンにバインドされ、認証機能はない。そのため、保守担当者はアクセス制御を追加せずに公開しないよう警告している。
Kevは自由形式の回答を生成するのではなく、テキストのまとまりや構造化データからなる「状態」と、候補となる選択肢を持つ質問を受け取り、それらの選択肢にわたる確率分布を返す。この形式は、顧客サポートの問い合わせを複数の部署に振り分けるといった作業に使える。その場合、単一のラベルを受け取るより、分類間の不確実性が見えるほうが有用なことがある。同梱された実演では、チェスの合法手を選択肢として用い、モデルに局面の評価を求めてもいる。
各チェックポイントは、ランク16のLoRAアダプターと小型のポインターヘッドをQwenの基盤モデルと組み合わせる。基盤モデルの重みは学習中も固定される。ポインター機構は各選択肢に対応する表現を採点し、その値を確率に変換する。再帰的なGated DeltaNet層を含むQwen3.5では、サーバーはキャッシュした状態を再利用しながら、質問を一つずつ別々に処理する。リポジトリーによると、これによって質問間の独立性を保つ。
公開モデルは、10種類の公開データセットから得た1万件の例に、生成した方針やルール構造の例を加え、2エポック学習させた。プロジェクトは開発用とテスト用の結果を分けて報告しているが、非公開モデルJevとの比較は、Jevの学習データが不明なため条件をそろえたものではないと注意を促す。また、fp32の試験では複数の別個の質問を一緒に尋ねても個別に尋ねてもほぼ同じ結果だったものの、選択肢の順番を変えると確率が変わることがあるとも述べている。
ハードウェア上の動作はモデル世代によって異なる。Qwen3.5版はCUDAシステムで専用カーネルを利用できるが、Apple Siliconでは現状、DeltaNet層に低速な参照実装を使う。旧世代のQwen3ベースのKevモデルも引き続き提供されており、Macではこちらのほうが高速な選択肢とされる。
したがって今回の公開は、独立した検証を受けた判断サービスではなく、実装の詳細と自己申告のベンチマークを公開した開発者向けプロジェクトとして捉えるのが適切だ。実用上の貢献は、コードの確認、チェックサム付きの重みのダウンロード、互換モデルの学習を含め、コンパクトな確率的分類器をローカルで試すための再現可能な道筋を示したことにある。



