出来事の日付:2026年6月23日。 FUTOは、低性能端末でも高速に動作するよう設計されたスワイプ入力システムと、推論、デコード、辞書制約付き検索を実行するC++ライブラリを公開した。このプロジェクトは3つの小型機械学習コンポーネントを組み合わせ、同意したボランティアから収集した100万件の英語QWERTYスワイプジェスチャーのデータセットを利用している。
データ収集は2024年8月、swipe.futo.orgのモバイルウェブサイトを通じて始まった。参加者はプロジェクトに関する説明を受けて同意した後、主にウィキペディアから引用した文章を、スワイプジェスチャーで1語ずつ入力した。少数の低品質サンプルを除外した後、FUTOは2025年3月、100万件のスワイプをMITライセンスの下でHugging Faceに公開した。
公開されたシステムは、言語やキーボードへの依存性が異なるタスクを分離している。汎用エンコーダーはスワイプの形状を解釈し、さまざまな配列や言語で動作することを意図しているが、FUTOによると、それ単体では最高の精度は得られない。小型のContextLMは、先行する単語を使って特定の言語における不自然な予測を減らす。3番目のモデルは、特定の言語とキーボード配列の特性を学習する。このデコーダーには対応するスワイプデータが必要なため、現在のリリースが対応するのはQWERTY配列の英語のみである。
FUTOの報告によると、3つのモデルすべてをビーム幅300で使用した場合、テストセットにおける上位4候補の失敗率は約4%だった。語彙に含まれない単語を除外すると、報告されたエラー率は1%未満に低下する。これらの数値は開発者による評価であり、提示された証拠にはテストデータの分割方法、比較対象のシステム、独立した再現についての説明はない。
エンコーダーは635,140個のパラメーターを持ち、デコーダーには304,155個が加わる。ContextLMには150万個のパラメーターがあり、そのうち約110万個は埋め込みである。FUTOは、アクティブなパラメーターを1,364,271個、総パラメーター数を2,494,767個としている。同組織によると、この小規模さにより、安価なハードウェア上でミリ秒単位の実行が可能になる。リリースによれば、訓練に必要だったのは常にワークステーション用GPU1基以下だった。
生のモデル予測は、実用的なキーボードを構成する一部にすぎない。スワイプ入力では、複数の候補経路を評価し、結果を妥当な単語に限定する必要がある。付属のswipe-libraryは、辞書制約付きビームサーチによってこの処理を行い、候補を採点し、モデル出力だけを提示するのではなく、単語の予測結果を返す。
このリリースは開発者に対し、オープンなデータセット、モジュール式のモデル、端末上で入力を実装する道筋を提供する。現時点での制約も同様に明確だ。最高水準の精度は、特定の言語と配列向けに訓練されたデコーダーに依存しており、利用可能なのは英語QWERTYのみである。対応範囲を広げるには、対象となる構成ごとに、同意を得て収集した新たなデータと評価が必要になる。公開データセットにより、外部チームも同じデータ群を使って別のアーキテクチャを試験できるが、その対象範囲と品質を慎重に考慮する必要がある。



