出来事の日付:2026年8月20日

開発者のサイモン・エドワードソンは、接続されたMIDIキーボードで演奏された音楽の続きを、1億2500万パラメーターのTransformerを使って生成する無料のiPhone・iPad向けアプリ「RollTab」の詳細を公開した。最大モデルはiPhone 15上で毎秒約108音を生成し、プロジェクトが目標とするリアルタイム演奏に十分な速度を実現している。

この作業にはほぼ1年にわたり、14回の実験を要した。システムは録音音声を処理するのではなく、音高、タイミング、長さ、ベロシティーなどの属性を表すMIDIイベントから学習する。初期のノートオンとノートオフによる表現では、音が鳴り続けたり、現在発音中の状態を追跡できなくなったりすることがあった。文法ベースの代替方式では有効なシーケンスを生成できたものの、音符1つにつき複数回の自己回帰ステップが必要だった。

最終的な表現方式では、イベント種別、音高、直前の発音開始からの経過時間、長さ、ベロシティーというカテゴリー項目を用い、1つの完全な音符をモデルの1ステップにまとめている。和音には、発音開始の追加遅延をゼロにした複数の音符を使用する。計算負荷の高いTransformerのバックボーンは音符ごとに1回動作し、より小さな出力コンポーネントが各項目を予測する。サステインペダルの動作は、独立したイベントとして表現するのではなく、前処理中に音符の長さへ組み込まれる。

学習には、約3億件の音符イベントを含む数十万個のMIDIファイルを使用した。エドワードソンは、ピアノ風の素材と著作権が消滅した古いクラシック音楽の素材に重点を置き、問題のある複数トラックの混在を取り除き、音楽的な網羅性に基づいてフィルタリングし、移調やテンポ変更を考慮しながら演奏データの重複を排除した。データセットを約5倍に拡大すると結果が悪化したため、量よりも選別とクリーニングを重視するようになった。

デコーダーのみのTransformerについて、約3300万、6400万、1億2500万パラメーターの3つのサイズをテストした。最大モデルが概して最も良い結果を示したものの、大差ではなかった。後半の音符項目を学習する際に、モデル自身による直前の予測をときどき使用するスケジュールドサンプリングは、検証損失を増加させたが、プロジェクトの評価では生成される続きの質を向上させた。

リスニングテストと単純な音楽的指標だけでは、一貫してモデルを選ぶには不十分だった。エドワードソンはGemini 3.5 Flashを使って一対比較を行い、生成された続きがプロンプトに沿っているかと、単独で聴いて良い音かを別々に判定した。そうして得られた選好から、直接選好最適化用の学習ペアを作成した。その段階の後、同じ自動評価において、最良のコンセンサス設定による出力の69.05%がベースモデルより好まれた。

デプロイのため、PyTorchモデルをCore MLにエクスポートし、重みを8ビットに量子化した。セッションが学習時の上限である512音に近づくと、直近の384音からコンテキストを再構築する。

RollTabは依然として実験的なものだ。短いプロンプトは扱いが難しく、生成がループする場合があり、初回起動時にはデバイスがモデルを最適化するため時間がかかる。それでもこのプロジェクトは、比較的小規模な記号音楽モデルが、モバイル端末上だけで対話的な生成を実行できることを示している。