Загрузка 0
ПОДЕЛИТЬСЯ

Мой блог

Листай вниз

Как я создавал нейромузыку без тошноты: эксперименты с YuE Studio

Как я создавал нейромузыку без тошноты: эксперименты с YuE Studio

Подробности изложены в материале первоисточника. Приветствую на сайте Sergey Bagrov! Меня зовут Сергей Багров, и сегодня я хочу рассказать о своем эксперименте с генеративной музыкой. Меня, как и многих, утомил бесконечный поток плоских ИИ-треков из популярных сервисов вроде Suno, от которых буквально отваливаются уши. Недавно я протестировал локальную модель YuE2 и решил построить вокруг нее собственную студию, чтобы получить на выходе вменяемое инди-звучание без пластикового привкуса.

Все подробные материалы по проекту, включая мой свежий альбом Static and Gold с разбором треков и примерами в формате «было — стало», доступны в открытом доступе.

Технический процесс обработки аудио
Процесс многоканальной обработки и мастеринга сгенерированного трека
Настройка воркера и параметров генерации
Конфигурация воркера для работы с моделью на видеокарте NVIDIA
Интерфейс MCP-сервера для ИИ-агента
Связь приложения с ИИ-агентом через протокол MCP
Финальный результат мастеринга трека
График динамического диапазона после применения функции дыхания

Зачем я это навайбкодил

Нейроконтент сегодня заполонил все рабочие и развлекательные площадки: задачи в трекерах, автоматические комментарии, сомнительные картинки и, конечно же, генеративные треки. Мои знакомые регулярно хвастаются результатами из коммерческих нейросетей, и слушать этот однородный цифровой шум бывает физически больно, хотя обижать авторов откровенным мнением не хочется.

Реклама

Когда мне показали возможности локальной модели YuE2, во мне взыграл профессиональный азарт. Я задался вопросом: смогу ли я обуздать этот инструмент так, чтобы результат не вызывал отторжения? Первые тесты едва не поставили крест на затее, но процесс настройки и поиска компромиссов меня по-настоящему увлек.

Шаг 1. Продвинутый генератор жанров

На первом этапе я спроектировал форму параметров, которая объединяет жанр, ритмику, гитарные партии, вокал и общую атмосферу в единую строку тегов для модели. Полученный материал уже можно было воспринимать на слух, однако звук оставался предельно плоским, однородным и зацикленным в рамках единого темпа. Платить за облачные сервисы желания не было, поэтому я продолжил дорабатывать систему локально.

Шаг 2. Внедрение драматургии трека

Следом я добавил элементы сценарного развития композиции: плавное нарастание, волнообразные переходы, ровные участки и мощные взрывы. Это немного оживило общую картину, но избыточная пластиковость и цифровая стерильность никуда не делись.

Шаг 3. Создание музыкальной студии

Осознав нехватку базовых инструментов аранжировки, я встроил в интерфейс барабанные сбивки, провалы и вокальные эффекты. Так родилась полноценная мини-студия, в которую вошли визуализация спектра с волной громкости, а также разделение композиции на дорожки. Стоит сделать ремарку: саму декомпозицию выполняет отдельная утилита demucs, разделяя трек ровно на четыре потока — ударные, бас, голос и общую музыкальную подложку, где гитары с клавишами слиты воедино.

Шаг 4. Работа с овердабом

Для большей гибкости я добавил функцию овердаба: загружаю собственную наброску, модель генерирует новую партию по нотам в ином стиле, а приложение аккуратно микширует ее с оригиналом. Полноценный надиктованный овердаб поверх живого исполнения нейросеть пока не вытягивает, но для экспериментов с аранжировкой этого вполне достаточно.

Шаг 5. Дыхание и мастеринг

Сырой вывод нейросети представляет собой монолитный «кирпич» с максимальной громкостью без тихих пауз, от чего слуховой аппарат моментально устает. Инструмент «дыхания» деликатно приглушает тихие фрагменты, сохраняя пики, благодаря чему у композиции появляется ощутимый контраст между куплетом и припевом. Финальным аккордом идет мастеринг: легкий перегруз по громкости, добавление «песка» на высоких частотах и лимитер пиков для защиты от неприятного хрипа.

Шаг 6. Эксперименты с подстановкой голоса

Стандартная генерация каждый раз наделяет трек случайным тембром, причем фиксированный seed здесь не помогает. Попытка зафиксировать единый голос через сторонний инструмент Seed-VC выявила ряд проблем: вокал начинает дрожать, будто исполнитель откровенно стесняется микрофона. Поскольку Seed-VC оптимизирован под разговорную речь, а не под пение, обучение и смена разделителей не дали идеального результата. Кроме того, неизбежные артефакты demucs при вырезке вокала цепляют остатки инструментов, портя общую чистоту звучания.

Шаг 7. Интеграция MCP и ИИ-агентов

Рутинные правки отнимают много времени, поэтому я спроектировал специальный MCP-сервер. Он транслирует ИИ-агенту список доступных возможностей приложения, позволяя прямо в диалоговом окне отдавать команды на модификацию трека и мгновенно оценивать звуковой результат.

Реклама
Главное окно программы YuE Studio
Главное окно приложения с элементами управления генерацией

Шаг 8. Интерфейс в стиле ретро

Интерфейсную часть я сделал максимально кастомной, вдохновляясь классическим Winamp2, адаптированным под современные стандарты и дополненным светлой темой оформления. Для меня этот плеер навсегда остался главным визуальным символом цифровой музыки.

Что получилось в итоге

Результатом экспериментов стал мини-альбом Static and Gold. Я ориентировался исключительно на собственные музыкальные пристрастия — отголоски Post-punk и Indie-рока в духе Joy Division, Interpol и Джека Уайта. Конечно, при прямой сопоставимости с живыми записями разница очевидна, но для локального ИИ-эксперимента итог меня более чем радует. У каждого трека есть своя посадочная страница с подробным описанием процесса создания.

Архитектура проекта

Программная часть распределена на несколько независимых модулей:

  • Воркер: функционирует на машине с видеокартой NVIDIA (от 16 ГБ VRAM), удерживая модель YuE2, очередь задач, вокальный движок и распознавание текста.
  • Клиентское приложение: работает на Linux, Windows или macOS, отвечая за интерфейс и локальный рендеринг эффектов через ffmpeg.
  • MCP-сервер: обеспечивает бесшовное взаимодействие с ИИ-агентами.

Исходный код проекта полностью открыт и опубликован на официальном репозитории GitHub (github.com/Zazza/yue-studio).

Интерфейс: путь одного трека

Современные интерфейсы интуитивно понятны благодаря ИИ-помощникам, поэтому детальный путеводитель по меню излишлен. Ниже представлены ключевые экраны рабочей среды.

Установка и системные требования

Для комфортной работы потребуется видеокарта NVIDIA с поддержкой CUDA и объемом видеопамяти от 16 ГБ, а также около 20 ГБ свободного пространства на диске под веса модели и воркер. Опционально можно догрузить Whisper для распознавания текста и Seed-VC для экспериментов с голосом.

Развертывание возможно как на едином ПК, так и в связке с удаленным GPU-сервером. Самый быстрый способ установки — доверить процесс ИИ-агенту через MCP-команды, которые проверяют системные требования и конфигурацию диска в безопасном режиме сухом прогона.

Технические ограничения

Модель не умеет разделять композицию на отдельные инструменты сверх четырех дорожек demusic. Вносить точечные правки в середину готового трека без полной пересборки нельзя, так как генерация идет последовательно. Удачный трек во многом зависит от удачной комбинации сидов, поэтому процесс порой требует терпения и ручного отбора удачных музыкальных основ.

Вкладка студии трека в интерфейсе программы
Панель редактирования дорожек и спектра в студии трека

Заключение

Разработка принесла мне массу удовольствия, позволив реализовать творческий потенциал в необычном формате. Я намерен продолжать работу над новыми релизами исключительно для собственного удовольствия.

Реклама
01.