Загрузка 0
ПОДЕЛИТЬСЯ

Мой блог

Листай вниз

Как нейросети слышат и создают музыку: разбор технологий и эксперимент с Suno и AssemblyAI

Как нейросети слышат и создают музыку: разбор технологий и эксперимент с Suno и AssemblyAI

Материал посвящён теме «Как нейросети слышат и создают музыку: разбор технологий и эксперимент с Suno и AssemblyAI». Ниже последовательно разберём главные вопросы, важные детали и практический контекст, чтобы легче ориентироваться в теме и понять логику дальнейшего изложения.

От синусоиды до нейросети: как цифра превращается в звук

Одно неверное исполнение ноты «ля» во время оркестровой репетиции моментально заставит дирижера остановить весь коллектив. На индивидуальном занятии преподаватель дотошно разберет эту ноту: проверит атаку, контроль дыхания, интонационный строй и вибрато, пока звучание не станет безупречным. Компьютер же при цифровой записи получает лишь 44 100 числовых отсчетов амплитуды за одну секунду, не имея ни малейшего понятия о том, что перед ним музыкальный элемент.

Возникает вопрос: каким образом из непрерывного потока цифр алгоритмы вытягивают высоту тона, человеческую речь, гармоническую структуру и аккорды? Чтобы это выяснить, я сперва разобрал математическую сторону обработки звукового сигнала, а затем провел практические тесты в сервисе Bothub. В первом эксперименте я произнес и пропел фразы для распознавания в AssemblyAI, а во втором — поставил задачу нейросети Suno, передав ей две версии одного замысла: свободный описательный промт и строгое техническое задание.

Реклама
Схема взаимодействие человека и генеративной аудиомодели
Точная настройка промта человеком остается ключевым условием получения нужного звучания.

Анализ частот и преобразование Фурье: почему ля — это не просто число

В нотной грамоте ля первой октавы расположена между второй и третьей линиями скрипичного ключа. Взглянув на партитуру, музыкант сразу определяет ноту, ее длительность, динамику и нюансы штриха. Если я возьму флейту и сыграю эту ноту перед микрофоном, физическая мембрана отреагирует на колебания воздушного давления, трансформируя их в электрический сигнал. Далее аналого-цифровой преобразователь фиксирует значения этого сигнала через равные временные интервалы.

При стандартной частоте дискретизации 44,1 кГц система выполняет 44 100 замеров в секунду. В 16-битном формате PCM каждое такое измерение для одного аудиоканала кодируется целым числом в диапазоне от −32 768 до 32 767. Важно не путать две абсолютно разные частотные величины: эталонная ля первой октавы соответствует примерно 440 колебаниям воздуха в секунду, тогда как частота дискретизации — это 44 100 замеров аппаратуры за тот же отрезок времени. На один полный период акустической волны приходится порядка ста цифровых точек, но ни одна из них сама по себе не содержит метки о музыкальной принадлежности.

Реальный инструмент никогда не выдает чистую математическую синусоиду на 440 Гц. Вместе с основным тоном микрофон улавливает гармонические обертоны и акустический шум выдыхаемого воздуха. Разложить этот сложный спектр помогает преобразование Фурье — математический инструмент, показывающий распределение энергии по различным частотам.

У каждого гармонического компонента есть собственные параметры: частота, амплитуда и фаза. При записи ноты ля основной пик будет находиться в районе 440 Гц, а выше расположатся гармоники на частотах 880, 1320 и 1760 Гц. Именно их соотношение определяет тембральную окраску: благодаря этому флейта, скрипка и гудок поезда звучат совершенно по-разному даже на одной высоте. Однако классическое спектральное представление не отражает динамику изменений во времени. Если я добавлю в игру вибрато — легкое покачивание высоты тона, — итоговый спектр покажет лишь расплывчатую полосу вокруг основного тона.

Чтобы отследить временную динамику, сигнал делят на короткие перекрывающиеся интервалы и рассчитывают спектр для каждого из них. Этот метод называется кратковременным преобразованием Фурье (STFT). Размер временного окна выбирается исходя из задачи. На частоте 44,1 кГц окно размером 2048 отсчетов занимает порядка 46 миллисекунд. Это дает хорошую детализацию по времени, но шаг между частотными ячейками составляет около 21,5 Гц, что затрудняет различение близких тонов.

Реклама

Если расширить окно до 8192 отсчетов, частотное разрешение улучшится до 5,4 Гц, однако временной интервал вырастет до 186 миллисекунд. Для анализа быстрых атак это критично: атака — это начальный фазовый всплеск ноты. За 186 миллисекунд к началу звука успеет добавиться установившаяся фаза, и алгоритм смешает их в один спектральный срез, точно определив частоту, но размыв временную границу начала звука.

Все полученные вычисления формируют двумерную матрицу, где по оси X откладывается время, по оси Y — частота, а значения ячеек отражают амплитуду. Наглядное цветовое отображение этой матрицы называется спектрограммой. Когда я проанализировал собственную запись флейты, основной тон составил 445 Гц. При стандарте в 440 Гц отклонение составило примерно 19,6 цента (цент — это одна сотая часть равномерно темперированного полутона). Я завысил ноту почти на пятую часть полутона. На реальной репетиции педагог не стал бы озвучивать сухие цифры, а просто посоветовал бы слегка повернуть инструмент, чтобы понизить строй.

Распознавание спетого текста в AssemblyAI: эксперимент с омофонами

Спектрограмма дает исчерпывающую информацию о частотном составе, но в ней нет готовых текстовых символов. Для извлечения слов применяются модели распознавания речи (ASR). Сервис AssemblyAI принимал мои аудиозаписи и возвращал текстовую расшифровку с временными метками и уровнем уверенности алгоритма.

Преобразование Фурье и частотный спектр сигнала
Преобразование Фурье раскладывает сложную волну на отдельные частотные составляющие.

Высота человеческого голоса формируется колебаниями связок, а различия гласных звуков определяются формантами — резонансными частотными зонами, возникающими в голосовом тракте. Изменение положения языка или губ смещает формантные пики, превращая звук «а» в «о». В процессе пения исполнитель растягивает гласные, на которые приходится основная длительность слогов, тогда как согласные звуки («т», «к», «д») физически невозможно тянуть секундами. Дополнительно на акустическую картину влияют вибрато, вокальное дыхание и нестандартные акценты.

Для тестирования алгоритма я подготовил контрольную фразу с фонологической ловушкой: «За домом был пруд, а рядом лежал прут». На конце слов «пруд» и «прут» происходит оглушение звонких согласных, из-за чего оба слова произносятся одинаково — [прут]. Правильное написание модель должна определять исключительно по контексту.

Я записал эту фразу в трех вариантах с одинакового расстояния до микрофона: проговоренная речь, пение на одной ноте и вокальное исполнение на простую мелодию. Результаты распознавания AssemblyAI распределились следующим образом:

Принцип работы кратковременного преобразования Фурье STFT
Использование временных окон позволяет отслеживать изменение частот во времени.
Способ исполнения Исходный текст Результат AssemblyAI Характер ошибки
Разговорная речь За домом был пруд, а рядом лежал прут За домом был пруд, а рядом лежал прут Без ошибок
Пение на одной ноте За домом был пруд, а рядом лежал прут За домом був пруд, а рядом лежав пруд «был» → «був», «лежал» → «лежав», «прут» → «пруд»
Вокальная мелодия За домом был пруд, а рядом лежал прут За домом был пруд, а рядом лежал пруд «прут» → «пруд»

В обыденной речи нейросеть корректно распознала оба контекстных омофона. Однако при вокальном исполнении AssemblyAI потеряла различие между «прудом» и «прутом», а в монотонном пении дополнительно исказила глаголы, выдав фонетические искажения («був», «лежав»).

Реклама

Генерация музыки в Suno и архитектура аудиомоделей

Если AssemblyAI переводит звук в текст, то сервис Suno работает в обратном направлении. Это генеративная модель, создающая по текстовому промту готовое музыкальное произведение с вокалом, аранжировкой и сведением. Разработчики Suno не раскрывают архитектурных деталей, поэтому неизвестно, использует ли система явное представление аккордовых цепочек и как она определяет тональный центр.

Анализ спектрограммы вокала и отклонения тона
Спектрограмма фиксирует точную высоту основного тона и отклонение в центах.

Тем не менее принцип работы подобного ИИ можно понять на примере открытых моделей. Трехминутный стереофайл с частотой 44,1 кГц состоит из почти 16 миллионов отсчетов. Для авторегрессионных моделей это слишком большой массив данных, приводящий к колоссальным вычислительным затратам и потере структуры композиции.

Для решения этой проблемы в модели MusicGen применяется нейронный кодек, сжимающий аудиосигнал в последовательность дискретных токенов. Трансформер предсказывает эти коды с учетом текстового описания. При этом отдельный код кодирует не изолированный нотный аккорд, а сжатый фрагмент многокомпонентного микса. В модели AudioLM используется разделение на две группы кодов: одна отвечает за глобальную музыкальную структуру, а вторая — за восстановление тембров и детализацию.

Эксперимент с промтами: абстрактный описательный запрос против технического ТЗ

Чтобы узнать, насколько точно нейросеть Suno улавливает специализированную музыкальную терминологию, я сгенерировал два трека на базе версии V4.5-ALL. Первый запрос я составил простым пользовательским языком, а второй — в виде четкого технического задания с указанием тональности, темпа, аккордовых последовательностей и структуры.

Сравнение результатов генерации музыки в Suno AI
Сравнение звучания композиций при использовании стандартного и технического промтов.

Вариант 1 (простой промт): «Быстрая рок-песня с женским вокалом. Куплет звучит напряженно и сдержанно, в припеве гитары раскрываются шире. Ровные ударные, повторяющийся мрачноватый рифф. После второго припева вступает резкая флейта с коротким соло. В конце припев повторяется еще раз, громче и плотнее.»

Вариант 2 (технический промт): «Рок-песня в ми миноре, размер 4/4, темп 132 удара в минуту. Женский альт. В куплете последовательность Em–C–G–D, восьмые у гитары приглушены ладонью. В припеве — открытые квинтовые аккорды и удвоенный вокал. После второго припева — восьмитактовый проигрыш: флейта играет соло, а в басу все это время тянется или повторяется нота ми. В финале — двойной припев.»

Параметр Результат абстрактного промта Результат технического промта
Жанр Стандартный гитарный поп-рок Уверенный прогрессив-рок
Темп Ощущается как быстрый (не задан) Около 129 BPM (очень близко к 132 BPM)
Тональность Ля минор (не задавалась) Соль минор (вместо запрашиваемого ми минора)
Гармония (аккорды) Не задавалась Последовательность Em–C–G–D сместилась из-за смены тональности
Фактура куплета Напряжение передано динамикой громкости Четкий прием Palm Muting (приглушение ладонью)
Фактура припева Плотные гитары, стандартный рок-припев Открытые квинты и удвоенный вокал (Double tracking)
Вокал Сопрано Альт
Соло инструменты Соло присутствует, но тембр ближе к народной жалейке Флейтовое соло точно в 8-тактовом проигрыше после 2-го припева
Финал Повтор припева Двойной финальный припев согласно ТЗ

Результаты эксперимента показали, что абстрактный промт задает общее направление, но оставляет нейросети полную свободу, из-за чего получается шаблонная композиция без ярких особенностей. В свою очередь, подробное техническое ТЗ заставило Suno выстроить точную формальную структуру, выдержать темп (129 BPM против 132 BPM), применить специфические гитарные приемы и корректно расположить соло. Главным промахом нейросети осталась тональность: вместо ми минора алгоритм построил трек в соль миноре.

ИИ-музыка в стриминге и реальные ограничения алгоритмов

По данным аналитики Яндекс Музыки за сентябрь 2026 года, искусственный интеллект применялся при создании 4,4% общего каталога и около 27% всех свежих релизов. Более того, треки, созданные нейросетями, активно завоевывают верхние строчки: в феврале 2026 года композиция «Сыпь, гармоника!» проекта СДП на стихи Сергея Есенина заняла первое место в главном чарте платформы.

В связи с этим стриминговые сервисы внедряют маркировку: правообладатели обязаны указывать факт генерации вокала, текста или музыки, а в карточках треков появляются соответствующие метки. Пользователям также стала доступна функция фильтрации «Меньше ИИ».

Исследование 200 реальных пользовательских запросов к сервису Udio показало, что жанровые теги наиболее стабильно передаются в итоговом звучании, тогда как глубокие сюжетные описания нейросеть часто игнорирует. Жанровый маркер кодирует комплексный паттерн — темп, характерные тембры, ритмическую сетку и манеру сведения. Если промт не содержит жестких технических ограничений, авторегрессионная модель выбирает наиболее вероятные шаблоны из обучающей выборки, генерируя типовой контент.

Итоги: как на самом деле нейросеть воспринимает и создает звук

У компьютера нет внутреннего понимания музыкальной теории или человеческой речи — он оперирует исключительно числовыми массивами. Преобразование Фурье помогает извлечь из сигнала частотные характеристики, распознавание речи интерпретирует акустические форманты в слова, а генеративные нейросети связывают текстовые векторы с аудиокодами.

Оба моих эксперимента продемонстрировали одинаковую тенденцию: алгоритмы отлично справляются с общей рамкой, но регулярно допускают ошибки в точных деталях. AssemblyAI распознал сложную фразу, но запутался в омофонах при вокальном исполнении. Suno воспроизвела структуру, приемы и темп, но ошибочно определила тональный центр. Для получения строго задуманного результата музыкальное управление со стороны человека остается ключевым элементом.

Трансформация рынка и личные мысли о собственных продуктах

Наблюдая за столь стремительным развитием нейросетевых инструментов, я все чаще ловлю себя на мысли о глобальной трансформации IT-индустрии. Традиционные подходы к разработке и производству контента меняются на глазах. В условиях, когда привычные модели найма теряют прежнюю стабильность, создание собственных нишевых продуктов перестает казаться слишком рискованным шагом — напротив, это становится логичным вектором развития.

Источник: habr.com

Реклама
01.