Мой блог
Как я создавал нейромузыку без тошноты: эксперименты с YuE Studio
Подробности изложены в материале первоисточника. Приветствую на сайте Sergey Bagrov! Меня зовут Сергей Багров, и сегодня я хочу рассказать о своем эксперименте с генеративной музыкой. Меня, как и многих, утомил бесконечный поток плоских ИИ-треков из популярных сервисов вроде Suno, от которых буквально отваливаются уши. Недавно я протестировал локальную модель YuE2 и решил построить вокруг нее собственную студию, чтобы получить на выходе вменяемое инди-звучание без пластикового привкуса.
Все подробные материалы по проекту, включая мой свежий альбом Static and Gold с разбором треков и примерами в формате «было — стало», доступны в открытом доступе.



Зачем я это навайбкодил
Нейроконтент сегодня заполонил все рабочие и развлекательные площадки: задачи в трекерах, автоматические комментарии, сомнительные картинки и, конечно же, генеративные треки. Мои знакомые регулярно хвастаются результатами из коммерческих нейросетей, и слушать этот однородный цифровой шум бывает физически больно, хотя обижать авторов откровенным мнением не хочется.
Когда мне показали возможности локальной модели YuE2, во мне взыграл профессиональный азарт. Я задался вопросом: смогу ли я обуздать этот инструмент так, чтобы результат не вызывал отторжения? Первые тесты едва не поставили крест на затее, но процесс настройки и поиска компромиссов меня по-настоящему увлек.
Шаг 1. Продвинутый генератор жанров
На первом этапе я спроектировал форму параметров, которая объединяет жанр, ритмику, гитарные партии, вокал и общую атмосферу в единую строку тегов для модели. Полученный материал уже можно было воспринимать на слух, однако звук оставался предельно плоским, однородным и зацикленным в рамках единого темпа. Платить за облачные сервисы желания не было, поэтому я продолжил дорабатывать систему локально.
Шаг 2. Внедрение драматургии трека
Следом я добавил элементы сценарного развития композиции: плавное нарастание, волнообразные переходы, ровные участки и мощные взрывы. Это немного оживило общую картину, но избыточная пластиковость и цифровая стерильность никуда не делись.
Шаг 3. Создание музыкальной студии
Осознав нехватку базовых инструментов аранжировки, я встроил в интерфейс барабанные сбивки, провалы и вокальные эффекты. Так родилась полноценная мини-студия, в которую вошли визуализация спектра с волной громкости, а также разделение композиции на дорожки. Стоит сделать ремарку: саму декомпозицию выполняет отдельная утилита demucs, разделяя трек ровно на четыре потока — ударные, бас, голос и общую музыкальную подложку, где гитары с клавишами слиты воедино.
Шаг 4. Работа с овердабом
Для большей гибкости я добавил функцию овердаба: загружаю собственную наброску, модель генерирует новую партию по нотам в ином стиле, а приложение аккуратно микширует ее с оригиналом. Полноценный надиктованный овердаб поверх живого исполнения нейросеть пока не вытягивает, но для экспериментов с аранжировкой этого вполне достаточно.
Шаг 5. Дыхание и мастеринг
Сырой вывод нейросети представляет собой монолитный «кирпич» с максимальной громкостью без тихих пауз, от чего слуховой аппарат моментально устает. Инструмент «дыхания» деликатно приглушает тихие фрагменты, сохраняя пики, благодаря чему у композиции появляется ощутимый контраст между куплетом и припевом. Финальным аккордом идет мастеринг: легкий перегруз по громкости, добавление «песка» на высоких частотах и лимитер пиков для защиты от неприятного хрипа.
Шаг 6. Эксперименты с подстановкой голоса
Стандартная генерация каждый раз наделяет трек случайным тембром, причем фиксированный seed здесь не помогает. Попытка зафиксировать единый голос через сторонний инструмент Seed-VC выявила ряд проблем: вокал начинает дрожать, будто исполнитель откровенно стесняется микрофона. Поскольку Seed-VC оптимизирован под разговорную речь, а не под пение, обучение и смена разделителей не дали идеального результата. Кроме того, неизбежные артефакты demucs при вырезке вокала цепляют остатки инструментов, портя общую чистоту звучания.
Шаг 7. Интеграция MCP и ИИ-агентов
Рутинные правки отнимают много времени, поэтому я спроектировал специальный MCP-сервер. Он транслирует ИИ-агенту список доступных возможностей приложения, позволяя прямо в диалоговом окне отдавать команды на модификацию трека и мгновенно оценивать звуковой результат.

Шаг 8. Интерфейс в стиле ретро
Интерфейсную часть я сделал максимально кастомной, вдохновляясь классическим Winamp2, адаптированным под современные стандарты и дополненным светлой темой оформления. Для меня этот плеер навсегда остался главным визуальным символом цифровой музыки.
Что получилось в итоге
Результатом экспериментов стал мини-альбом Static and Gold. Я ориентировался исключительно на собственные музыкальные пристрастия — отголоски Post-punk и Indie-рока в духе Joy Division, Interpol и Джека Уайта. Конечно, при прямой сопоставимости с живыми записями разница очевидна, но для локального ИИ-эксперимента итог меня более чем радует. У каждого трека есть своя посадочная страница с подробным описанием процесса создания.
Архитектура проекта
Программная часть распределена на несколько независимых модулей:
- Воркер: функционирует на машине с видеокартой NVIDIA (от 16 ГБ VRAM), удерживая модель YuE2, очередь задач, вокальный движок и распознавание текста.
- Клиентское приложение: работает на Linux, Windows или macOS, отвечая за интерфейс и локальный рендеринг эффектов через ffmpeg.
- MCP-сервер: обеспечивает бесшовное взаимодействие с ИИ-агентами.
Исходный код проекта полностью открыт и опубликован на официальном репозитории GitHub (github.com/Zazza/yue-studio).
Интерфейс: путь одного трека
Современные интерфейсы интуитивно понятны благодаря ИИ-помощникам, поэтому детальный путеводитель по меню излишлен. Ниже представлены ключевые экраны рабочей среды.
Установка и системные требования
Для комфортной работы потребуется видеокарта NVIDIA с поддержкой CUDA и объемом видеопамяти от 16 ГБ, а также около 20 ГБ свободного пространства на диске под веса модели и воркер. Опционально можно догрузить Whisper для распознавания текста и Seed-VC для экспериментов с голосом.
Развертывание возможно как на едином ПК, так и в связке с удаленным GPU-сервером. Самый быстрый способ установки — доверить процесс ИИ-агенту через MCP-команды, которые проверяют системные требования и конфигурацию диска в безопасном режиме сухом прогона.
Технические ограничения
Модель не умеет разделять композицию на отдельные инструменты сверх четырех дорожек demusic. Вносить точечные правки в середину готового трека без полной пересборки нельзя, так как генерация идет последовательно. Удачный трек во многом зависит от удачной комбинации сидов, поэтому процесс порой требует терпения и ручного отбора удачных музыкальных основ.

Заключение
Разработка принесла мне массу удовольствия, позволив реализовать творческий потенциал в необычном формате. Я намерен продолжать работу над новыми релизами исключительно для собственного удовольствия.
