Мой блог
Очистка вокальных семплов с помощью нейросети LALAL.AI Lynx

Использование вокальных семплов из интернета или с виниловых пластинок — проверенный способ придать треку выразительность. Бу то акапелла, выделенный стем или фрагмент диалога из старого фильма, удачно вписанный голос добавляет глубину и динамику практически любому музыкальному произведению. Однако исходный материал далеко не всегда оказывается безупречно чистым. Ролики на YouTube часто страдают низким качеством звучания, а записи с винила могут содержать слишком много шума и треска. Процесс, такой как очистка вокальных семплов, становится необходимым этапом перед тем, как материал попадет в цифровую рабочую станцию (DAW), если только стилистика трека не требует намеренной «грязи» в звуке.
Компания LALAL.AI, получившая известность благодаря своим алгоритмам разделения аудио на стемы, представила новую разработку — алгоритм Lynx. В этом материале мы протестируем его возможности на различных типах вокальных записей и покажем, как интегрировать их в готовые треки.


Что такое LALAL.AI Lynx?
Сервис предлагает целый набор инструментов на базе искусственного интеллекта для удаления вокала, его клонирования и очистки. Новая нейросеть Lynx разработана специально для изоляции голоса и устранения посторонних шумов и артефактов. Разработчики потратили год на обучение алгоритма распознаванию звуковой «грязи» и ее отделению от человеческой речи.


Интерфейс инструмента интуитивно понятен. Работать с ним можно через веб-сайт, десктопное приложение, мобильную программу для iOS (iPhone или iPad), а также в виде плагина непосредственно в DAW (доступно только в тарифе Pro). В данном обзоре рассматривается работа с десктопной версией.

Принципы работы с алгоритмом
Процесс начинается с запуска программы и перетаскивания в окно аудиофайла, требующего обработки. Пользователю предлагается несколько вариантов работы. Режим Voice & Noise предназначен для очистки и включает в себя алгоритм Lynx, тогда как функция Vocal & Instrumental служит для извлечения вокала из готовых музыкальных композиций с целью создания акапелл.
После выбора режима Voice & Noise открывается меню дополнительных настроек:
- В поле «Нейросеть» необходимо убедиться, что выбран вариант v7 Lynx.
- Уровень шумоподавления настраивается в трех положениях: «Мягкий» (Mild), «Нормальный» (Normal) или «Агрессивный» (Aggressive). Практика показывает, что режим Normal обеспечивает оптимальный баланс между эффективностью очистки и сохранением исходного качества.
- Присутствует опция подавления эха (de-echo), которая полезна для записей, сделанных в помещениях с сильной реверберацией.
Перед запуском процесса рекомендуется активировать функцию создания предварительного просмотра (Create preview), чтобы избежать лишних трат в случае ошибки. После нажатия кнопки старта приложение разделяет вокал и шум на два независимых файла. Если результат устраивает, полная версия сохраняется нажатием кнопки Full. Рассмотрим применение алгоритма на трех различных примерах.
Очистка кинодиалогов
Фрагменты диалогов из кинематографа часто используются для создания драматического эффекта в композициях. Отличным источником служат фильмы, перешедшие в общественное достояние — картины первой половины XX века, не защищенные авторским правом. На видеохостингах собраны тысячи таких лент, однако их звучание зачастую оказывается зашумленным. Так, фрагмент диалога из старого фильма ужасов до обработки звучал грязно и с трудом поддавался использованию.
После прогона через LALAL.AI с установленным нормальным уровнем шумоподавления звук стал значительно чище и пригоднее для работы. После небольшой подрезки, изменения темпа (time-стретчинга), а также применения эквалайзеров и компрессии этот семпл органично вписался в аранжировку трека в жанре спид-гараж вместе с лупами из библиотеки Splice.
Очистка вокала с винила
Музыканты используют семплирование акапелл с грампластинок на протяжении многих десятилетий. Современные технологии выводят этот процесс на новый уровень, позволяя добиваться идеальной чистоты звучания.
До появления современных технологий разделения дорожек музыкантам приходилось искать сомнительные сборники акапелл на виниле в специализированных магазинах для диджеев. Поскольку такие пластинки часто выпускались пиратским способом, покупателям доставались копии низкого качества, записанные с другого винила, а также потрепанная поверхность с постоянным треском. Чтобы проверить возможности сервиса в подобных условиях, специалисты создали собственный аналог низкокачественной записи. Сначала они выгрузили вокальную версию трека «My House» проекта Fingers Inc. и легендарного Чак Робертса с YouTube в разрешении 240p, затем перенесли файл в Ableton Live и добавили с помощью бесплатного плагина iZotope Vinyl царапины, щелчки и электрические помехи.
Для очистки этот загрязненный файл загрузили в очередь LALAL.AI. Учитывая серьезный уровень шума, сперва был задействован режим агрессивного шумоподавления (Aggressive). Он справился с помехами хорошо, однако оказался слишком грубым по отношению к исходному полезному сигналу, поэтому настройки снизили до стандартного уровня (Normal). Дополнительно активировали функцию удаления эха, поскольку в оригинальной композиции вокал Робертса сопровождался характерным слэпбэк-эффектом. Алгоритм не справляется со сложными задачами идеально, но результат все равно значительно превосходит исходное состояние.
Поскольку система не просто глушит помехи, а именно отделяет их от голоса, на выходе пользователь получает два отдельных файла, позволяя оценить качество работы с удаленным шумом. На финальном этапе очищенный вокал интегрировали в трек в стиле британского гэриджа (UKG), используя лупы из Splice, а также добавили сатурацию, эквализацию, компрессию, реверберацию и задержку, чтобы голос органично зазвучал в общем миксе.
Ремикширование с использованием вокальных стемов
В рамках еще одного эксперимента специалисты проверили, как алгоритм справляется с очисткой вокала, который он сам же извлек из музыкального произведения. Чтобы воспроизвести полноценный рабочий процесс ремикса в сложных условиях, выбрали концертную запись классиков рок-музыки 1970-х годов группы Kiss — композицию «Do You Love Me?» из их концертного альбома Kiss Destroys Anaheim 76, сопровождающуюся громкими посторонними криками из зала.
Фрагмент трека загрузили в приложение, выбрав разделение на вокал и инструмент (Vocal & Instrumental). Как отмечалось ранее, этот алгоритм не предоставляет специального режима очистки, выполняя лишь базовое разделение стемов. Из-за обилия хлопков, оваций и прочих шумов на живом выступлении результат оказался не столь безупречным. Тем не менее, применив нормальный уровень обработки и функцию удаления эха, удалось добиться максимальной чистоты вокальной партии для дальнейшей работы.
Полученный изолированный вокал группы Kiss поместили в кислотный хаус-трек вместе с лупами из Splice, дополнительно усилив сатурацией, эквалайзером, компрессором и прочими пространственными эффектами под названием Limosine acid.
Стоимость и тарифные планы
Инструмент LALAL.AI Lynx доступен по нескольким ценовым категориям. Пользователям предлагается бесплатный базовый тариф (Starter), вариант Lite стоимостью 7,50 долларов в месяц и расширенная версия Pro за 15 долларов в месяц. Кроме того, предусмотрена возможность разовой покупки кредитов и пополнения баланса.
Источник: attackmagazine.com

