Мой блог
Meta представила Muse Glimmer: 30-миллиардная модель для работы на домашних GPU

Meta представила Muse Glimmer: 30-миллиардный агентный ИИ для локального запуска
Компания Meta официально выпустила Muse Glimmer — мультимодальную модель с 30 миллиардами параметров, которая представляет собой результат глубокой дистилляции архитектуры Muse Spark. Новинка спроектирована специально для обеспечения функционирования локальных агентных рабочих процессов, работающих в режиме «всегда включенного» помощника. Модель распространяется под свободной лицензией Apache 2.0. Примечательно, что базовая модель в полной точности требует более 55 ГБ видеопамяти, однако инженеры Meta реализовали эффективное сжатие весов до уровня примерно 4 бит. В сочетании с поблочной спекулятивной декодировкой это позволяет запускать Muse Glimmer на одном потребительском графическом процессоре или компьютере Mac без обращения к облачным серверам, что критически важно для производительности в реальных агентных циклах. Модель уже доступна для самостоятельного хостинга, а коллекция Hugging Face включает веса BF16, GGUF k-quants, сборки ExecuTorch и компонент DFlash.
Развертывание и целевая аудитория
Модель ориентирована на три основных сегмента. Индивидуальные разработчики и стартапы могут запускать решение на одной видеокарте с 24 ГБ памяти или на компьютерах Apple с чипами M4/M5 Max. Команды среднего бизнеса получают возможность организации локального (on-prem) инференса без необходимости оплаты каждого запроса (per-token bill). Регулируемые предприятия получают доступ к агентным возможностям в изолированных контурах (air-gapped). Meta настоятельно советует внедрять системные механизмы безопасности (guardrails) вместо использования модели как «голой» конечной точки. Спектр применения Muse Glimmer охватывает критически важные индустрии, где резидентность данных, работа в офлайн-режиме или жесткие требования к задержкам исключают облачные вызовы: здравоохранение, юридическую и финансовую сферы, оборонную промышленность, общественный сектор, производство и полевое обслуживание. Конкретные сценарии включают настольные агенты, способные анализировать скриншоты, системы написания кода, работу со схемами, понимание документов и диаграмм, синтез данных, а также оценку через подход «LLM-as-a-judge».
Архитектурные особенности и процесс обучения
Muse Glimmer является плотным причинно-следственным трансформером, оснащенным специализированным энкодером восприятия. Общее количество параметров составляет около 30 млрд, включая визуальную «башню». В архитектуре применяется внимание с групповыми запросами (GQA): 32 головы запросов и 2 головы ключей/значений. Реализован паттерн внимания [Локальный, Локальный, Локальный, Глобальный] со скользящим окном в 2048 токенов. Ротационное позиционное кодирование (RoPE) применяется только к локальным слоям с параметром theta 500 000. Визуальный блок представляет собой ViT-G/14 (около 1,8 млрд параметров), обрабатывающий до 4096 визуальных токенов на изображение. Длина контекста превышает 131 072 токена, словарь составляет 202 048 токенов, а точка отсечения знаний — 4 января 2026 года. Модель поддерживает входные данные из текста и изображений (видео обрабатывается как отдельные кадры), аудио не поддерживается. Обучение проходило в три этапа: пре-тренинг с дистилляцией логитов Muse Spark, промежуточное обучение на данных с длинным контекстом и сложными цепочками рассуждений, и пост-тренинг, объединяющий supervised fine-tuning с обучением с подкреплением и on-policy дистилляцией для различных доменов, включая кодинг и агентные задачи.
Оптимизация: от 55 ГБ до потребительского железа
Сжатие до 4 бит позволяет уменьшить вес языковой модели до 20 ГБ, что оставляет достаточно ресурсов в рамках 24- или 32-гигабайтных систем для размещения KV-кэша, визуального энкодера и компонентов дешифратора. Доступны две версии квантования: K-Quant-Dynamic (для 32 ГБ VRAM, среднее падение точности 0,2%) и K-Quant-17GB (для 24 ГБ VRAM, падение 1,0%). Скорость генерации достигается за счет DFlash — механизма, предсказывающего 16 токенов за один проход, которые основная модель проверяет параллельно. DFlash использует 5 слоев, внимание со скользящим окном 2048, 32 головы запросов и 8 голов KV. На RTX 5090 при batch size 1 пропускная способность возрастает с 74,9 до 233,4 токен/с (рост 3,1х). На Apple M5 Max производительность повышается с 26,6 до 50,2 токен/с, а на M4 Max — с 23,7 до 37,8 токен/с.
Результаты тестирования, безопасность и ключевые выводы
В тестах на общую логику и агентную работу Muse Glimmer превосходит Gemma4-31B и Qwen3.6-27B. По MCP Atlas модель набирает 75,5 баллов против 54,2 и 62,5 у конкурентов. Высокие показатели также зафиксированы в DeepSearch QA (74,6), Gaia2 (43,3) и SWE-Bench Pro (51,2). Результаты в рассуждениях: AIME 2026 — 94,7, IFBench — 77,0, AA-LCR — 80,0. Однако Qwen3.6-27B сохраняет лидерство в задачах TerminalBench 2.1 (60,7 против 77,2 в SWE-Bench Verified) и OSWorld-Verified (75,6 против 65,9). В плане безопасности уровень успеха атак по методологии Siren AgentDojo составляет 28,4 при уровне полезности 94,2. Согласно фреймворку Meta, модель не является «Frontier AI», а риски в био-химической и кибер-сферах оцениваются как умеренные или низкие. Ключевые выводы: Muse Glimmer — это 30-миллиардная модель с открытыми весами для агентных задач, которая благодаря DFlash обеспечивает высокую скорость работы, оставаясь эффективной альтернативой облачным решениям для защищенных секторов бизнеса.
Источник: marktechpost.com

