YuE2: открытая нейросеть для создания песен с редактируемой партитурой на уровне Suno v5

YuE2 song generation AI

Команда из HKUST, HKGAI и сообщества Multimodal Art Projection (M-A-P) представила YuE2 — открытую нейросеть для создания песен. Сначала она сочиняет композицию в виде читаемой партитуры, а потом исполняет её как готовый трек с вокалом. Партитуру можно поправить вручную или через LLM-агента и получить новую версию песни, а если снять ноты с чужой записи, модель без дообучения исполнит кавер в другом стиле.

В слепом прослушивании эксперты предпочли YuE2 песням Suno v4.5 в 57.3% сравнений против 30.5%. С Suno v5 вышла почти ничья: 40.4% против 39.9%. На бенчмарке WildSongBench у этой настройки 6.96 балла по SongBench, больше, чем у всех 15 других моделей в сравнении. Правда, отрыв от ближайших Mureka 9 (6.94) и Suno v5 (6.87) авторы не считают статистически значимым. Тесты показали, что партитура делает песню лучше: с ней эксперты выбирали трек в 49.3% сравнений, без неё в 34.6%. Веса YuE2 (3.58 млрд параметров) и вспомогательных моделей MERT2, SheetSage2 и VAE открыты на Hugging Face под некоммерческой лицензией CC BY-NC 4.0. При этом частным авторам и музыкантам отдельно разрешили продавать сгенерированные песни. Бенчмарк выложен с кодом оценки. Код инференса и навык yue2-music для LLM-агентов опубликованы в GitHub-репозитории, код первой YuE перенесён в отдельную ветку. Примеры песен опубликованы на странице проекта.

Индекс качества песен и индекс соответствия описанию на WildSongBench: YuE2 и YuE2 (Bo8) рядом с Suno v5, Suno v6 и Mureka 9, открытые модели ниже и левее
По качеству песен и попаданию в описание YuE2 ближе к Suno и Mureka, чем к открытым моделям

Зачем генератору песен партитура

Песню можно описать по уровням: текст и настроение, ноты и аккорды, исполнение и тембр, звуковая волна. Генерацию сверху вниз по этим уровням авторы называют постепенным принятием музыкальных решений (progressive musical commitment). Символьные модели вроде Music Transformer останавливаются на нотах, а аудиомодели вроде MusicLM, MusicGen и первой YuE сразу выдают запись, пряча композицию внутри. Похожий путь от нот к песне описывала Seed-Music от ByteDance, но её реализация закрыта. YuE2 проходит все уровни в одной открытой модели и оставляет партитуру доступной для правки.

Пирамида уровней генерации YuE2: текст и слова песни, символьная партитура, семантические токены, акустические латенты, звуковая волна
Постепенное принятие музыкальных решений (progressive musical commitment): от текста песни к звуковой волне

Партитуру YuE2 пишет в нотации ABC, то есть обычным текстом: темп, размер, тональность, такты, метки куплета и припева, аккорды и ноты. ABC разбивается на токены тем же BPE-токенизатором, что и слова песни, а править такую запись может и человек, и внешняя языковая модель.

Как устроена YuE2

Генерация идёт в три шага: партитура, затем семантические токены, затем акустические латентные представления (латенты). Для них звук делится на фреймы по 40 мс, и каждый фрейм описывается 64 числами. Семантические токены добавляют то, что неудобно записать нотами, а из латентов отдельный вариационный автоэнкодер (VAE) собирает стерео 48 кГц.

Все три шага выполняет один трансформер из 28 слоёв по схеме Mixture-of-Transformers (MoT): в каждом слое два эксперта со своими весами и общим механизмом внимания. Авторегрессионный (AR) эксперт пишет партитуру и токены по одному, как языковая модель пишет текст. Неавторегрессионный (NAR) эксперт обрабатывает все фреймы сразу и методом flow matching постепенно превращает шум в латенты. Маска внимания гибридная: партитуру и семантические токены модель пишет, опираясь только на уже сгенерированное, а звуковые фреймы видят все токены и друг друга.

Архитектура YuE2: AR-эксперт с каузальным вниманием пишет партитуру ABC и семантические токены, NAR-эксперт с двунаправленным вниманием предсказывает акустические латенты для VAE, внизу офлайн-цели от SheetSage2, MERT2 и энкодера VAE
Один чекпоинт создаёт песни, правит их и делает каверы, меняется только источник партитуры

Модель обучили на 346 тысячах часов музыки, в основном на записях под лицензией CC0 и синтетических данных. В обучении смешивали четыре задачи, от полной цепочки до генерации звука без партитуры и токенов, поэтому один чекпоинт умеет работать и с планом, и без него.

Откуда брать ноты для обучения: SheetSage2 и MERT2

В обычных записях нет разметки нот и аккордов, поэтому авторы сделали два инструмента. SheetSage2 слушает песню целиком и выдаёт в ABC мелодию, аккорды, тональность, ритмическую сетку и структуру. Среди сравниваемых транскриберов он лучший в 12 из 15 пар бенчмарков и метрик: например, F1 для вокальной мелодии на RWC-Pop вырос с 62.71 у первой версии до 82.51. Энкодер MERT2 (632 млн параметров) учился на 700 тысячах часов аудио предсказывать коды замаскированных фрагментов, полученные из двух замороженных энкодеров, MuQ и Qwen2-Audio. В итоге он стал лучшим в 14 из 15 метрик бенчмарка MARBLE. Его квантованная ветка выдаёт семантические токены для YuE2 со скоростью 375 бит в секунду.

YuE2 против Suno и Mureka: качество на уровне закрытых моделей

Сравнение шло на WildSongBench: 192 реальных запроса на китайском и английском. Автоматические метрики оценивали качество и музыкальность песни (SongBench, SongEval), качество продакшна (AudioBox), соответствие описанию и разборчивость слов (PER). В таблице YuE2 встречается дважды, но это одна и та же модель. В строке YuE2 она, как и все конкуренты, делает два варианта на запрос, и в зачёт идёт тот, где слова разборчивее. А в строке YuE2 (Bo8) вариантов восемь (best-of-8), и лучший выбирается по SongBench Musicality. С двумя вариантами YuE2 лидирует среди открытых моделей по SongBench (6.73), хотя у шести из восьми конкурентов параметров больше. По AudioBox PQ, которая в отборе не участвовала, оба режима обходят все закрытые модели.

Таблица: SongBench, SongEval, AudioBox PQ, MuLan, AllMusicCaps, Q3O и PER для Suno v4.5, v5, v5.5, v6, v6 Wild, MiniMax Music 2.6, Mureka 9, YuE2 и YuE2 (Bo8)
YuE2 (Bo8) впереди по SongBench и Q3O, Suno v5 по MuLan и AllMusicCaps

Главным доказательством качества модели авторы считают слепое прослушивание. В нём 62 оплачиваемых эксперта с консерваторским образованием или опытом исследований в аудио-ИИ дали 3602 парные оценки, из них 2545 пришлись на сравнение с закрытыми моделями. С Mureka 9 результат тоже почти равный, а вот Suno v6 эксперты предпочли в 59.3% случаев против 31.6%, хотя по SongBench впереди YuE2. По качеству звука YuE2 (Bo8) в среднем выбирали в 58.9% сравнений с шестью закрытыми моделями (ничьи делили пополам). В итоге YuE2 выглядит открытым аналогом Suno уровня v5, но не последних версий.

Доли предпочтений экспертов по общему качеству и качеству звука: YuE2 и YuE2 best-of-8 против Suno v4.5, v5, v5.5, v6, v6 Wild и Mureka 9
YuE2 (Bo8) обходит Suno v4.5, почти равна Suno v5 и Mureka 9 и уступает новым версиям Suno

Что дают партитура и единая архитектура

Чтобы проверить саму идею, один и тот же чекпоинт запускали с планом и без него на одинаковых промптах. С партитурой песню предпочли в 49.3% ответов, без неё в 34.6% (p = 0.007), по мелодии 44.0% против 29.5%, по аккордам 39.0% против 21.0%.

Предпочтения экспертов для генерации с партитурой и без неё: общее качество, музыкальность, мелодия и аккордовая последовательность
С партитурой эксперты чаще выбирали песню по всем четырём критериям

На примере видно, откуда разница: с планом куплет развивает один мотив, а припев повторяет его на октаву выше. Без плана куплет четыре раза повторяет одну и ту же фигуру из нот си, ре, ми, ми.

Фрагменты нот куплета и припева двух песен с одинаковым промптом: с символьным планированием мотив развивается и возвращается в припеве, без планирования фраза повторяется
С планом (слева) мотив куплета возвращается в припеве октавой выше, без плана фраза просто повторяется

Вторая проверка касается архитектуры. Многие генераторы песен собраны из двух частей: языковой модели (LM) для токенов и диффузионного трансформера (DiT) для звука. Такую пару по 1.7 млрд параметров обучили на том же объёме данных и с тем же планированием, и эксперты выбрали единую MoT в 53.4% ответов против 35.6% (p = 0.0084).

Правки, ИИ-каверы и LLM-агент

Партитура полезна, только если модель её слушается. Сгенерированные песни прогнали через SheetSage2: сходство мелодии с планом 0.9464, аккордов 0.9246, а у песни по другой партитуре с тем же промптом всего 0.2160 и 0.2473. Правки работают точечно: после замены аккордов в припеве запись совпадает с новыми аккордами на 79.54%, а мелодия с исходной на 93.43%. Оценка SongBench после правок почти не меняется.

Для кавера SheetSage2 снимает партитуру с записи, а YuE2 исполняет её в новом стиле. На 948 песнях из SHS100K, которых не было в обучающих данных, модель поиска каверов CLEWS находила по сгенерированной версии другие исполнения той же песни с mAP 0.647. У специализированной SongEcho этот показатель 0.419. Без аккордов в партитуре узнаваемость падает до 0.598, а без партитуры почти до нуля (0.006), зато музыкальность растёт.

Таблица: поиск исходной песни по кавер-версиям через CLEWS и Discogs-VINet, соответствие стилю и качество для SongEcho, ACE-Step 1.5 и YuE2 с полной партитурой, без аккордов и без партитуры
Без аккордов узнаваемость падает до 0.598, без партитуры до 0.006, зато растут соответствие стилю и качество звука

Читаемая партитура подходит и для LLM-агентов. В демо песня The Last Train за 14 версий превратилась из китайского поп-трека в англоязычный джаз: агент правил ноты, стиль и текст по просьбам исследователя, а YuE2 исполняла каждую версию.

По разборчивости слов (PER 0.0844) YuE2 уступает семи из 15 конкурентов, в том числе Suno v4.5 (0.0580) и лучшей из открытых моделей MiniMax Music 3 (0.0627). Рекорд 6.96 требует восьми генераций на песню и отчасти объясняется тем, что лучший вариант отбирают по SongBench Musicality.

Как попробовать YuE2 бесплатно и запустить локально

Создать песню с помощью YuE2 без установки можно в бесплатном веб-демо от NOIZ, одного из партнёров проекта, но число бесплатных генераций там ограничено. Кроме того, модель запускается в сторонних разделах на Hugging Face, например, в YuE2-3B Music Generator. В карточке модели указаны английский и китайский языки, поддержку русского авторы не заявляют.

Для локального запуска авторы указывают Linux, Python 3.10+, видеокарту NVIDIA на 24 ГБ с поддержкой BF16 и 24 ГБ оперативной памяти. Впрочем, в тестах пик видеопамяти составил около 11 ГиБ, а на максимальной длине контекста 14.1 ГиБ. На RTX 4090 песня длиной 3.6 минуты генерируется за 71 секунду. Пакет yue2_infer ставится через pip из GitHub-репозитория или готовым колесом (wheel) с Hugging Face. На вход он берёт описание стиля и текст с метками куплетов и припевов, а параметр cot включает полный план (full), только мелодию для каверов (melody) или генерацию без партитуры (off). Для правки или кавера передают готовую партитуру ABC. В ComfyUI для YuE2 есть нативные ноды и официальный воркфлоу text-to-music.

Можно ли использовать песни YuE2 в коммерческих целях

Веса YuE2-3B и декодеров YuE2-Vae распространяются под лицензией CC BY-NC 4.0, которая в общем случае запрещает коммерческое использование. Однако 16 сентября авторы добавили к ней отдельное разрешение для частных пользователей, авторов контента и музыкантов. Они могут бесплатно генерировать песни, публиковать, продавать и лицензировать их, в том числе на коммерческих площадках, без отчислений разработчикам. Обязательное условие — ответственное использование: модель и сгенерированные песни нельзя применять в незаконных и обманных целях, например для мошенничества или выдачи себя за другого человека. На компании это разрешение не распространяется: для коммерческого использования весов им нужна отдельная лицензия от авторов, а продавать или коммерчески распространять сами веса не разрешено.


neurohive telegram
Подписаться
Уведомить о
guest

0 Comments
Старые
Новые Популярные