発生日:2026年8月10日

Cactus Computeは、低価格ハードウェア上でのツール呼び出し、デバイス制御、構造化データ抽出向けに設計されたオープンモデル「Needle 2」を公開した。この4,500万パラメータモデルは、エンジン、トークナイザー、文法コンパイラーを単一の14MBのC++バイナリに収め、約28MBのセッションメモリを使用する。

このプロジェクトは、意図的に一般的なチャットを対象外としている。自然言語による指示を、腕時計、家電、ロボット、アプリケーションが公開する関数と型付き引数に対応付ける。構造化抽出にも同じ仕組みを使用する。提供されたスキーマを、出力を有効なフィールド、列挙値、配列、オブジェクトに制限する文法へ変換し、不正な構造が生成されるのを防ぐ。

すべての応答には、学習済みの信頼度スコアが含まれる。製品開発者はしきい値を設定し、ローカルで実行するか、ユーザーに明確化を求めるか、クラウドモデルへエスカレーションするかを決められる。話題から外れた要求には、推測する代わりに空の呼び出しを返すことができる。この設計により、Needleは汎用言語モデルの代替ではなく、ハイブリッドシステムを構成する一要素として位置付けられる。

Needle 2は、メモリ使用量を一定範囲に抑えるため、256トークンのスライディング・アテンション・ウィンドウを使用する。一方、システム指示とツール宣言は固定され、長いセッション中にも追い出されない。重み、アクティベーション、キー・バリューキャッシュは、学習後にのみ圧縮されたのではなく、Cactus独自の量子化手法を用いて学習された。デプロイ時の表現は、重み当たり平均約2ビットとなる。

ユニバーサルバイナリはプロセッサを調べ、SDOT、NEON、AVX2、RISC-Vベクトル、WebAssembly SIMD、またはスカラーの各カーネルから選択する。Cactusの報告によると、デコード速度はRaspberry Pi 5で毎秒約500トークン、一部のVRハードウェアで400~1,500トークン、200ドル未満のサムスンAシリーズ端末で300~700トークンとなる。外部メモリを備えた新しいマイクロコントローラーも対象として挙げられている。

Googleの961行からなるMobile Actions評価で、Needleは順序付き完全一致精度63.7%を達成した。69.1%のLFM2.5 230Mと64.0%のFunctionGemma 270Mには及ばなかったが、公表された比較では、57.6%のオンデバイスAppleモデルを上回った。2つのSeal-Toolsテストでは、Needleが掲載された小規模モデルのベースラインを上回った。Cactusは、重要な非対称性を指摘している。競合モデルは16ビット精度で動作する汎用モデルだったのに対し、Needleは大幅に圧縮され、デバイス操作向けに狭く特化して学習されている。

このモデルは、独自の1,150億トークンのコーパスで事前学習され、380億トークンで追加学習されている。製品ごとに固定されたツール語彙に合わせ、ローカルでファインチューニングでき、Apache 2.0ライセンスで提供される。Pebbleは、オフラインの音声操作用としてIndex 01アプリで採用している。

したがって、Needle 2が掲げるのは、厳しいメモリおよび電力制限下での特化である。独自のベンチマークは、競争力のある領域と明確な弱点の両方を示しており、自由回答型の知識や会話よりも、プライバシーを守ったオフラインでの関数選択が重要な場面に最も適している。