出来事の日付:2026年9月30日

Rustでゼロから実装された独立系ソフトウェアプロジェクトが、小型の再帰型アーキテクチャで同程度の規模のTransformerより効率よくテキストを学習・生成できるかを検証している。PSSAと呼ばれるこのプロジェクトは、実運用に使える完成済みモデルではなく、初期段階の研究実装として公開されている。公表された結果は、独立した第三者によって再現されていない。

PSSAは、再帰型の状態空間層を通じてテキストを1トークンずつ処理する。固定サイズの状態を次の処理に引き継ぎ、蓄積したエピソード記憶を参照し、実行中に重みの一部を書き換えることができる。リポジトリによると、この実装はPyTorchやTensorFlowなどの機械学習フレームワークに依存していない。実行時に直接利用する依存ライブラリは、ダウンロードやバイト単位のトークン化などを担う。

開発者は、コーパス、トークナイザー、オプティマイザーのスケジュール、乱数シード、パラメーター数を同じにして、従来型のTransformerと条件をそろえた比較を行ったと報告している。クリーニング済みのWikiText-103の1,270万トークンを使った学習では、最終的なクロスエントロピーがPSSAで3.98、Transformerで4.43だったとリポジトリに記録されている。未見のデータの一部を使った別の評価でも同程度の優位性が維持されたという。ただし、プロジェクト側は実験の規模が依然として小さいと注意を促している。

リポジトリは、同じCPU上での生成速度も高かったと報告している。この結果は、設計上の狙いと整合する。再帰型モデルは処理ステップ間で状態を引き継げる一方、基本的なTransformerは拡大するコンテキストを繰り返し処理する。この比較を、PSSAが現在の大規模言語モデルを上回る証拠と受け取るべきではない。開発者は、この規模では試験した両モデルとも生成する文章の品質が低く、より大規模な試験と、より強力な再帰型モデルを比較対象とした検証がなお必要だと明記している。

ドキュメントの学習速度の数値は、とりわけ慎重に解釈する必要がある。ある実行ではPSSAがGPUによる高速化を利用した一方、比較対象の学習処理はCPUのみだった。このためリポジトリは、目立つ形で示された学習速度の数値では、アーキテクチャを公平に比較できないとしている。同じCPUを使った測定ではPSSAの優位性はより小さく、損失の比較は経過時間ではなくトークン数と更新回数をそろえて行われている。

重要な疑問がいくつか残っている。報告された差が10倍または100倍の規模のモデルでも維持されるか、記憶の蓄積機構が結果を実質的に改善するか、そして現在の再帰型モデルを基準にした場合にどのような性能になるかは、まだ確認されていない。コーパスを変更した後の知識の保持を調べる試験も未完了だ。

コードは誰でも確認できる形で公開され、Issueやプルリクエストを受け付けている。現時点でPSSAは、再帰的な状態、検索に似た記憶、オンライン適応を独特の形で組み合わせた、検証過程が公開された実験と捉えるのが適切だ。初期の数値は追加試験に値するものだが、より広い結論を導くには、独立した再現実験と大幅に規模を拡大した評価が必要となる。