YuE2 is een geavanceerd model voor muziekgeneratie dat symbolische planning verenigt met audio-output. Het model creëert eerst een bewerkbare partituur voordat deze wordt omgezet in volledige audio met zang en begeleiding, waarbij het in benchmarks zoals SongBench concurreert met Suno v5.
Het ecosysteem bestaat uit drie kernonderdelen:
- YuE2: Het hoofdmodel met 3,59 miljard parameters dat muziek kan creëren, coveren en bewerken.
- MERT2: Een systeem voor muziekrepresentaties dat state-of-the-art prestaties levert in het analyseren van genre, toonsoort en emotie op de MARBLE-benchmarks.
- SheetSage2: Een model dat audio-opnamen transcribeert naar bewerkbare lead sheets in ABC-notatie, wat vervolgens als trainingsdoel voor YuE2 dient.
De modellen zijn getraind op aanzienlijke hoeveelheden CC0-muziek en synthetische data van Tokenwave.AI, met trainingsdatasets die variëren van 28.400 uur (SheetSage2) tot 700.000 uur (MERT2).
YuE2: Grensverleggende Muziek met Symbolische Planning
Model en Resultaten
YuE2 (best-of-8) behaalt een score van 6,9632 op SongBench. Dit is het hoogste waargenomen gemiddelde van de 15 geëvalueerde instellingen op WildSongBench (gebaseerd op 192 prompts). Ter vergelijking behaalt Suno v5 in dezelfde vergelijking een score van 6,8721.
Modelarchitectuur: Componeren in symbolen, uitvoeren in audio
Een bewerkbare partituur wordt omgezet in semantische muziek-tokens, akoestische latents en volledige audio van het nummer. Het model heeft ongeveer 3,59 miljard parameters en 28 lagen, en ondersteunt het creëren, coveren en bewerken van muziek. De AR (Auto-Regressieve) en NAR (Non-Auto-Regressieve) experts delen een attention computation, maar maken gebruik van afzonderlijke normalisatie, projecties en MLP's.
MERT2: Muziekrepresentaties
MERT2 levert de muziekrepresentaties die ten grondslag liggen aan zowel analyse als generatie. Een ConvNeXt-frontend en een 24-laags Conformer leren het voorspellen van gemaskeerde codes die zijn opgebouwd uit complementaire MuQ- en Qwen2-Audio-functies.
Aanpassing van het volledige nummer voorziet SheetSage2 van muzikale context; een aparte causale tak fungeert als de 25-Hz semantische tokenizer van YuE2.
State-of-the-art op MARBLE
MERT2-30s en MERT2-FS (full-song) behalen state-of-the-art (SOTA) resultaten op 14 van de 15 MARBLE-metrieken, waarbij ze voorop lopen in het herkennen van tagging, toonsoort, genre en emotie.
- Genre-nauwkeurigheid (GTZAN): MERT2-30s behaalt een score van 91,72.
- Verfijnde nauwkeurigheid toonsoort (GiantSteps): MERT2-FS behaalt een score van 67,05.
MERT2 Benchmark-scores (MARBLE)
Hogere scores zijn beter. Vetgedrukt markeert de hoogste weergegeven score.
| Benchmark / Metriek | Beste gepubliceerde baseline | MERT2-30s | MERT2-FS |
| MTT $\cdot$ Tagging (ROC-AUC) | 91,70 (PupuJEPA-Large) | 91,91 | 91,74 |
| MTT $\cdot$ Tagging (Gem. precisie) | 40,80 (PupuJEPA-Large) | 41,29 | 41,20 |
| GiantSteps $\cdot$ Toonsoort (Verfijnde nauwkeurigheid) | 66,10 (PupuJEPA-Large) | 66,97 | 67,05 |
| GTZAN $\cdot$ Genre (Nauwkeurigheid) | 86,90 (PupuJEPA-Large) | 91,72 | 90,69 |
| GTZAN $\cdot$ Beat (F1) | 91,00 (PupuJEPA-Large) | 90,59 | 90,57 |
| EmoMusic $\cdot$ Valence (R²) | 62,50 (PupuJEPA-Large) | 63,23 | 63,52 |
| EmoMusic $\cdot$ Arousal (R²) | 78,50 (PupuJEPA-Huge) | 80,01 | 78,14 |
| MTG-Jamendo $\cdot$ Instrument (ROC-AUC) | 78,40 (PupuJEPA-Large) | 80,27 | 80,27 |
| MTG-Jamendo $\cdot$ Instrument (Gem. precisie) | 21,20 (PupuJEPA-Large) | 22,89 | 23,51 |
| MTG-Jamendo $\cdot$ Stemming/thema (ROC-AUC) | 76,20 (PupuJEPA-Large) | 79,44 | 78,74 |
| MTG-Jamendo $\cdot$ Stemming/thema (Gem. precisie) | 15,50 (Dasheng-1.2B) | 16,68 | 15,74 |
| MTG-Jamendo $\cdot$ Genre (ROC-AUC) | 86,30 (AudioMAE++) | 88,01 | 87,98 |
| MTG-Jamendo $\cdot$ Genre (Gem. precisie) | 20,10 (PupuJEPA-Large/Huge) | 21,22 | 20,66 |
| MTG-Jamendo $\cdot$ Top 50 (ROC-AUC) | 83,10 (AudioMAE++/PupuJEPA-Huge) | 84,18 | 84,13 |
| MTG-Jamendo $\cdot$ Top 50 (Gem. precisie) | 31,10 (AudioMAE++) | 32,17 | 31,62 |
Toelichting bij MERT2: Beide encoders hebben 632M parameters. MERT2-30s gebruikt een trainingscontext van 30 seconden; MERT2-FS gebruikt 300 seconden.
SheetSage2: Van audio naar partituur
SheetSage2 zet een opname om in een bewerkbare lead sheet. Een full-song MERT2-FS encoder, aangepast met LoRA, voedt een zeslaagse autoregressieve decoder. Taak-prompts selecteren beats, secties, toonsoorten, akkoorden en melodieën; een gedeelde tijdlijn van gebeurtenissen wordt omgezet in ABC-notatie met zang- en instrumentale melodiestemmen. Deze partituren dienen als symbolische trainingsdoelen voor YuE2.
Zes transcriptietaken, één model
SheetSage2 behaalt SOTA op 10 van de 13 benchmark-metrieken met één enkel model voor de transcriptie van beat, downbeat, toonsoort, akkoord, structuur en melodie.
- Zangmelodie (RWC-Pop): Pitch-class note F1 score van 82,51.
- Akkoordherkenning (osu2017): Maj/min score van 90,08.
SheetSage2 Benchmark-scores
Scores × 100; hogere scores zijn beter.
| Benchmark / Taak | Metriek | Beste vergelijking | SheetSage2 |
| GTZAN | Beat F1 | 88,75 (Beat This!) | 85,65 |
| osu2017 | Beat F1 | 91,55 (Madmom) | 92,29 |
| GTZAN | Downbeat F1 | 78,28 (Beat This!) | 79,51 |
| osu2017 | Downbeat F1 | 84,99 (Beat This!) | 91,97 |
| GiantSteps | Toonsoort (Weighted score) | 74,62 (Madmom) | 77,73 |
| GTZAN | Toonsoort (Weighted score) | 74,43 (S-KEY) | 75,77 |
| osu2017 | Akkoord (Maj/min) | 84,59 (Jiang et al. 2019) | 90,08 |
| Chords1217 | Akkoord (Maj/min) | 84,09 (ChordFormer) | 83,81 |
| HarmonixSet | Structuur (Nauwkeurigheid) | 80,03 (SongFormer) | 80,51 |
| HarmonixSet | Structuur (Boundary F1 $\cdot$ 0.5 s) | 70,63 (SongFormer) | 67,96 |
| HarmonixSet | Structuur (Boundary F1 $\cdot$ 3 s) | 79,50 (SongFormer) | 82,86 |
| RWC-Pop | Melodie (Vocal pitch-class F1) | 62,71 (SheetSage1) | 82,51 |
| RWC-Pop | Melodie (Full pitch-class F1) | 64,02 (SheetSage1) | 75,29 |
Trainingsgegevens
De modellen zijn voornamelijk getraind op CC0-muziek en synthetische data. Tokenwave.AI levert onder licentie het grootste deel van de synthetische trainingsdata.
Omvang van de trainingsdata:
- MERT2: 700.000 uur
- SheetSage2: 28.400 uur
- YuE2: 346.000 uur
YuE2: Grensverleggende Muziek met Symbolische Planning
Model en Resultaten
YuE2 (best-of-8) behaalt een score van 6,9632 op SongBench. Dit is het hoogste waargenomen gemiddelde van de 15 geëvalueerde instellingen op WildSongBench (gebaseerd op 192 prompts). Ter vergelijking behaalt Suno v5 in dezelfde vergelijking een score van 6,8721.
Modelarchitectuur: Componeren in symbolen, uitvoeren in audio
Een bewerkbare partituur wordt omgezet in semantische muziek-tokens, akoestische latents en volledige audio van het nummer. Het model heeft ongeveer 3,59 miljard parameters en 28 lagen, en ondersteunt het creëren, coveren en bewerken van muziek. De AR (Auto-Regressieve) en NAR (Non-Auto-Regressieve) experts delen een attention computation, maar maken gebruik van afzonderlijke normalisatie, projecties en MLP's.
MERT2: Muziekrepresentaties
MERT2 levert de muziekrepresentaties die ten grondslag liggen aan zowel analyse als generatie. Een ConvNeXt-frontend en een 24-laags Conformer leren het voorspellen van gemaskeerde codes die zijn opgebouwd uit complementaire MuQ- en Qwen2-Audio-functies.
Aanpassing van het volledige nummer voorziet SheetSage2 van muzikale context; een aparte causale tak fungeert als de 25-Hz semantische tokenizer van YuE2.
State-of-the-art op MARBLE
MERT2-30s en MERT2-FS (full-song) behalen state-of-the-art (SOTA) resultaten op 14 van de 15 MARBLE-metrieken, waarbij ze voorop lopen in het herkennen van tagging, toonsoort, genre en emotie.
- Genre-nauwkeurigheid (GTZAN): MERT2-30s behaalt een score van 91,72.
- Verfijnde nauwkeurigheid toonsoort (GiantSteps): MERT2-FS behaalt een score van 67,05.
MERT2 Benchmark-scores (MARBLE)
Hogere scores zijn beter. Vetgedrukt markeert de hoogste weergegeven score.
| Benchmark / Metriek | Beste gepubliceerde baseline | MERT2-30s | MERT2-FS |
| MTT $\cdot$ Tagging (ROC-AUC) | 91,70 (PupuJEPA-Large) | 91,91 | 91,74 |
| MTT $\cdot$ Tagging (Gem. precisie) | 40,80 (PupuJEPA-Large) | 41,29 | 41,20 |
| GiantSteps $\cdot$ Toonsoort (Verfijnde nauwkeurigheid) | 66,10 (PupuJEPA-Large) | 66,97 | 67,05 |
| GTZAN $\cdot$ Genre (Nauwkeurigheid) | 86,90 (PupuJEPA-Large) | 91,72 | 90,69 |
| GTZAN $\cdot$ Beat (F1) | 91,00 (PupuJEPA-Large) | 90,59 | 90,57 |
| EmoMusic $\cdot$ Valence (R²) | 62,50 (PupuJEPA-Large) | 63,23 | 63,52 |
| EmoMusic $\cdot$ Arousal (R²) | 78,50 (PupuJEPA-Huge) | 80,01 | 78,14 |
| MTG-Jamendo $\cdot$ Instrument (ROC-AUC) | 78,40 (PupuJEPA-Large) | 80,27 | 80,27 |
| MTG-Jamendo $\cdot$ Instrument (Gem. precisie) | 21,20 (PupuJEPA-Large) | 22,89 | 23,51 |
| MTG-Jamendo $\cdot$ Stemming/thema (ROC-AUC) | 76,20 (PupuJEPA-Large) | 79,44 | 78,74 |
| MTG-Jamendo $\cdot$ Stemming/thema (Gem. precisie) | 15,50 (Dasheng-1.2B) | 16,68 | 15,74 |
| MTG-Jamendo $\cdot$ Genre (ROC-AUC) | 86,30 (AudioMAE++) | 88,01 | 87,98 |
| MTG-Jamendo $\cdot$ Genre (Gem. precisie) | 20,10 (PupuJEPA-Large/Huge) | 21,22 | 20,66 |
| MTG-Jamendo $\cdot$ Top 50 (ROC-AUC) | 83,10 (AudioMAE++/PupuJEPA-Huge) | 84,18 | 84,13 |
| MTG-Jamendo $\cdot$ Top 50 (Gem. precisie) | 31,10 (AudioMAE++) | 32,17 | 31,62 |
Toelichting bij MERT2: Beide encoders hebben 632M parameters. MERT2-30s gebruikt een trainingscontext van 30 seconden; MERT2-FS gebruikt 300 seconden.
SheetSage2: Van audio naar partituur
SheetSage2 zet een opname om in een bewerkbare lead sheet. Een full-song MERT2-FS encoder, aangepast met LoRA, voedt een zeslaagse autoregressieve decoder. Taak-prompts selecteren beats, secties, toonsoorten, akkoorden en melodieën; een gedeelde tijdlijn van gebeurtenissen wordt omgezet in ABC-notatie met zang- en instrumentale melodiestemmen. Deze partituren dienen als symbolische trainingsdoelen voor YuE2.
Zes transcriptietaken, één model
SheetSage2 behaalt SOTA op 10 van de 13 benchmark-metrieken met één enkel model voor de transcriptie van beat, downbeat, toonsoort, akkoord, structuur en melodie.
- Zangmelodie (RWC-Pop): Pitch-class note F1 score van 82,51.
- Akkoordherkenning (osu2017): Maj/min score van 90,08.
SheetSage2 Benchmark-scores
Scores × 100; hogere scores zijn beter.
| Benchmark / Taak | Metriek | Beste vergelijking | SheetSage2 |
| GTZAN | Beat F1 | 88,75 (Beat This!) | 85,65 |
| osu2017 | Beat F1 | 91,55 (Madmom) | 92,29 |
| GTZAN | Downbeat F1 | 78,28 (Beat This!) | 79,51 |
| osu2017 | Downbeat F1 | 84,99 (Beat This!) | 91,97 |
| GiantSteps | Toonsoort (Weighted score) | 74,62 (Madmom) | 77,73 |
| GTZAN | Toonsoort (Weighted score) | 74,43 (S-KEY) | 75,77 |
| osu2017 | Akkoord (Maj/min) | 84,59 (Jiang et al. 2019) | 90,08 |
| Chords1217 | Akkoord (Maj/min) | 84,09 (ChordFormer) | 83,81 |
| HarmonixSet | Structuur (Nauwkeurigheid) | 80,03 (SongFormer) | 80,51 |
| HarmonixSet | Structuur (Boundary F1 $\cdot$ 0.5 s) | 70,63 (SongFormer) | 67,96 |
| HarmonixSet | Structuur (Boundary F1 $\cdot$ 3 s) | 79,50 (SongFormer) | 82,86 |
| RWC-Pop | Melodie (Vocal pitch-class F1) | 62,71 (SheetSage1) | 82,51 |
| RWC-Pop | Melodie (Full pitch-class F1) | 64,02 (SheetSage1) | 75,29 |
Trainingsgegevens
De modellen zijn voornamelijk getraind op CC0-muziek en synthetische data. Tokenwave.AI levert onder licentie het grootste deel van de synthetische trainingsdata.
Omvang van de trainingsdata:
- MERT2: 700.000 uur
- SheetSage2: 28.400 uur
- YuE2: 346.000 uur