Мой блог
MiniMax-Music3: новая нейросеть для создания пятиминутных музыкальных композиций

Компания MiniMax выпустила MiniMax-Music3 — полноценную модель для генерации музыки, распространяемую с открытыми весами. В отличие от многих исследовательских прототипов, этот инструмент готов к реальному внедрению с момента релиза, состоявшегося 13 августа 2026 года. Модель способна создавать законченные музыкальные композиции длительностью до пяти минут в формате 32 кГц, 16-бит стерео WAV, принимая на вход два типа данных: текст песни с тегами разметки структуры и детальное текстовое описание музыкального стиля и аранжировки.
Практическая применимость и лицензионные условия
MiniMax-Music3 позиционируется как инструмент, готовый к эксплуатации сразу после запуска. Вместе с весами компания предоставила код для инференса и три варианта интеграции, что позволяет использовать технологию соло-разработчикам, инди-студиям и командам среднего бизнеса. Лицензия MiniMax-Music3 допускает коммерческое использование, однако выдвигает специфические требования: в пользовательском интерфейсе продукта необходимо разместить заметное упоминание о модели. Важным ограничением является порог годовой выручки: организации, чей доход от продуктов на базе данной модели превышает 20 миллионов долларов США, обязаны получить от MiniMax отдельное письменное разрешение. Кроме того, владельцы платформ, предоставляющих сторонним пользователям возможность генерации контента, обязаны внедрить и поддерживать системы фильтрации для предотвращения нарушения авторских прав.
Спектр индустрий, где может быть востребован этот инструмент, охватывает разработку компьютерных игр, рекламные и брендинговые агентства, создание контента для социальных сетей, образовательные проекты (e-learning), подкастинг, фитнес-приложения, а также специализированный ритейл (фоновая музыка в торговых точках) и SaaS-решения в области музыкальных технологий. Практические сценарии использования варьируются от создания адаптивного игрового саундтрека и локализованных рекламных джинглов до написания черновых демо-версий песен и генерации плейлистов под определенное настроение в условиях, когда API-запросы сторонних сервисов экономически невыгодны.
Архитектурные решения: Hybrid-LM и синтез на основе потоков
Техническая архитектура MiniMax-Music3 представляет собой сочетание иерархического авторегрессионного стека и тракта непрерывного синтеза. Процесс обучения токенизатора базируется на восьми слоях остаточного векторного квантования (RVQ). Первый слой, именуемый семантическим кодобуком, содержит 16 384 записи и отвечает за формирование базовой музыкальной семантики и структуры. Последующие семь слоев, каждый из которых содержит 1 024 записи, отвечают за кодирование акустических деталей. При обучении сначала достигается оптимизация семантического слоя, после чего все восемь слоев обучаются совместно.
Система Hybrid-LM разделяет вычислительную нагрузку. Глобальная языковая модель на 8 миллиардов параметров отвечает за предсказание первого RVQ-кодобука и формирование долгосрочной структуры трека. В то же время локальная языковая модель на 0,6 миллиарда параметров выполняет предсказание оставшихся слоев в рамках каждого фрейма. Стоит отметить, что вопрос о базовой архитектуре модели остается предметом обсуждения: в официальной карточке модели указана Qwen3-8B, тогда как в публикациях MiniMax Research упоминается Qwen3.5-8B.
Этап синтеза является наиболее нетривиальным решением: разработчики отказались от прямого декодирования дискретных RVQ-токенов. Вместо этого финальные скрытые состояния обеих языковых моделей объединяются и служат условием для работы модуля потокового сопоставления (flow matching) с 2,4 млрд параметров. Полученные данные направляются в скрытое пространство, которое декодируется с помощью 123-миллионного Flow-VAE, заимствованного из проекта MiniMax Speech. Таким образом, при выполнении инференса классический декодер токенизатора не задействуется вовсе.
Управление вводом и параметры развертывания
Для корректной работы модели текст песни должен быть размечен специальными тегами: [Intro], [Verse], [Pre-Chorus], [Chorus], [Post-Chorus], [Bridge], [Instrumental], [Solo] и [Outro]. Структурированное описание стиля (Structured Caption) включает метаданные, детали вокала и аранжировки. Для автоматизации этого процесса MiniMax подготовила агентский навык (music-caption-rewriter), который расширяет краткий запрос пользователя до необходимого формата.
Для запуска системы предложено три официальных пути. Референсным сервером является SGLang-Omni, который, согласно документации GitHub, требует использования двух графических процессоров: GPU 0 отвечает за работу Qwen3 и авторегрессионную генерацию, а GPU 1 — за потоковое сопоставление и декодирование. Модульный конвейер на базе diffusers требует менее 24 ГБ видеопамяти при работе в полной точности, однако этот показатель может быть снижен до 22 ГБ с автоматической выгрузкой в CPU и до 8 ГБ при использовании групповой выгрузки на уровне листьев. Для пользователей ComfyUI доступен шаблон, использующий перепакованные веса в форматах FP16 и INT8.
Ключевые характеристики
- Модель с открытыми весами для генерации пятиминутных треков (32 кГц, 16-бит стерео).
- Гибридная архитектура (8B Global LLM + 0,6B Local LLM), подающая данные на 2,4B flow-matching модуль и 123M Flow-VAE.
- Процесс синтеза полностью исключает декодер токенизатора, работая на fused-состояниях.
- Гибкое потребление ресурсов: от двух GPU для SGLang-Omni до оптимизированных 8 ГБ VRAM в diffusers.
- Разрешение коммерческого использования с условием атрибуции и необходимостью авторизации при выручке свыше 20 млн USD.
Источник: marktechpost.com

