出来事の日付:2026年9月29日
PostHogは、あらかじめ定められた選択肢から選び、較正された確率を返す必要のあるタスク向けに、実験的なオープンソースモデルJeevesを公開した。このプロジェクトは、Jev型の意思決定モデルに明示的な推論段階を加え、重み、配信コード、SDK、再現可能な学習パイプラインを公開している。
Jevに類するシステムは、取り得る判断に確率を割り当てるよう設計されているが、正確さでは汎用の推論モデルに及ばない場合がある。開発者はしばしば、難しい事例を別のモデルに送ることで補っている。これに対しJeevesは、低ランク適応と独立したポインターヘッドを使ってQwen3.5-9Bモデルを学習させ、利用可能な選択肢を採点する前に推論できるようにする。
このプロジェクトでは、教師ありファインチューニングに続いてCISPOによる強化学習を行う。Jeevesは推論の連鎖を生成した後、専用の意思決定トークンにクエリー表現を置き、各選択肢に付与された表現と比較する。ソフトマックスでそのスコアを確率に変換し、開発用データに合わせて調整した温度パラメーターを用いて較正を改善する。
PostHogによると、この方式は学習対象領域外のタスクで結果を改善し、JevBenchの公開難関区分でJevを上回る。公開された比較は、ベンチマークの公開区分であるeasy、standard、hardの231項目に限られ、非公開のjudge区分は含まれていない。また、Kev-9BについてのJeevesベンチマーク結果は公開されていないため、一部の比較値には規模の異なるKevモデルのものを用いていると、リポジトリは説明している。これらの数値は独立評価ではなくプロジェクト自身による報告であるため、こうした留保は重要だ。
チーム自身の試験では、推論による測定可能な改善が見られた。同一のチェックポイントで、2962項目のテスト用データに対するスコアは、思考なしでは0.804、推論を有効にすると0.840だった。チームは学習ステップ402を採用した。それより後の強化学習ステップでは、学習用のデータ群に対する出力確率が過度に確信的になったためだ。
Jeevesには、生成を高速化するための、投機的生成に用いる拡散型ドラフト生成器も含まれる。Orthrusに着想を得ており、マスクトークンが畳み込み後のキーとバリューに対してクロスアテンションを行えるようにすることで、Qwen3.5のGated DeltaNet層で動作するよう調整されている。複数の質問をまとめて処理する際のコストを抑えるため、標準設定ではブロックサイズを4としている。
開発者は公開済みの重みをダウンロードしてローカルサーバーを動かすことも、学習済みチェックポイントを統合して単体で使えるモデルにすることもできる。同梱のPythonクライアントは、Jevの型付きSDKをそのまま置き換えられるものとして提供され、標準ではローカルのエンドポイントに接続し、APIキーを必要としない。データ準備用のスクリプトは、固定されたリビジョンの公開データセットを取得し、それぞれの元のライセンスを維持する。
今回の公開によって、研究者は検証できる具体的な実装を得た。ただし、より広範な主張の妥当性は、独立したベンチマーク、非公開の評価、実際のさまざまな用途での性能にかかっている。現時点ではJeevesは、構造化された推論によって確率的な意思決定システムを改善できるかを探るための、公開されたモデルと手順として捉えるのが適切だ。



