新たな音楽生成研究システムのYuE2は、AIで作られる楽曲の制御性を高めるため、記号的な作曲と音声合成を組み合わせている。テキストプロンプトから完成した録音へ直接進むのではなく、まず歌詞とスタイルの指示を、確認して編集できる楽曲設計に変換する。
この中間設計には、メロディー、リズム、コードなどの要素が含まれる。ユーザーは歌詞、テンポ、編曲、メロディーの選択を変更し、その後、歌声と伴奏を含む新しい一曲全体を生成できる。この手法は、内部の見えない別の出力を音声モデルに何度も求める場合よりも、意図的に修正できるようにすることを狙っている。
YuE2チームの報告によると、SongBenchにおける同システムのbest-of-eight構成の平均スコアは6.9632で、同じ評価におけるSuno v5の6.8721を上回った。比較には、15種類のシステム設定でテストした192件のプロンプトからなるWildSongBenchが使われた。best-of-eightとは、音楽性、プロンプト制御、歌詞の正確性を基準として、8回の生成結果から1件を選んだことを意味する。これらはプロジェクト側が報告した自動評価の結果であり、順位は指標や選択方法によって変わり得る。
より広範なリリースでは、MERT2-30sとMERT2-FSという2種類の音楽表現エンコーダーについても説明している。いずれも6億3,200万個のパラメーターを持ち、学習時のコンテキストはそれぞれ30秒と300秒だ。チームによると、この2モデルは、タグ付け、調、ジャンル、感情の認識などのタスクを対象としたMARBLE比較で、15指標中14指標において首位の結果を出した。
関連する採譜モデルSheetSage2は、1つのシステムで複数の形態の音楽構造を抽出するよう設計されている。拍、強拍、調、コード、セクション、メロディーを扱う。研究者らは、SheetSage1、Madmom、タスク特化型システムを含む比較において、13のベンチマーク指標のうち10指標で首位のスコアを記録したと報告している。Chords1217データセットにおけるChordFormerでは交差検証が使われているなど、一部の評価条件はモデル間で異なるため、首位指標数の概要はその文脈を踏まえて読む必要がある。
学習データの出所は、このプロジェクトの説明で目立つ要素となっている。チームによると、モデルは主としてパブリックドメインのCC0音楽と合成素材で学習され、合成学習データの大半はTokenwave.AIがライセンスに基づいて提供した。
したがって、YuE2の最も特徴的な発想は、主張される音質だけではない。作曲とレンダリングを分離することで、プロンプトと波形の間にユーザーから見える構造を設けている点だ。この手法がデモの範囲を超えてうまく応用できれば、記号的な設計によって、エンドツーエンドの音声システムの速度を保ちながら、生成音楽の指示、修正、評価が容易になる可能性がある。
デモは複数のジャンルと言語にまたがり、テンポ、編曲、言葉、メロディーを意図的に変更することで、素材をどのように作り変えられるかを示している。



