Мой блог
Reflection AI представила Beam: мощную open-weight MoE-модель с 501 млрд параметров
Компания Reflection AI объявила о создании своей первой открытой модели Beam, которая представляет собой разреженную архитектуру Mixture-of-Experts (MoE). Общее количество параметров новинки составляет 501 миллиард, из которых 23 миллиарда являются активными для каждого токена.
Система разработана с упором на программирование, логические рассуждения и выполнение сложных агентских задач. По заявлениям разработчиков, решение успешно конкурирует с более крупными открытыми аналогами, расходуя при этом в 3–4 раза меньше вычислительных ресурсов на этапе инференса.
Что представляет собой архитектура Beam
Beam позиционируется как универсальный агентский инструмент, созданный с нуля командой Reflection AI для корпоративных сценариев использования и автоматизации процессов кодинга. Эксперты компании отмечают продвижение западного рубежа моделей с открытыми весами, делая ставку на максимальную эффективность при инференсе, хотя конкуренты вроде Kimi K3 сохраняют лидерство по сырой производительности.
Параметры рассуждения и гибкость
Пользователи получили доступ к специальной настройке интенсивности рассуждений (reasoning effort). Уменьшение этого параметра позволяет системе выдавать быстрые и лаконичные ответы, в то время как высокие значения задействуют глубокий анализ для решения сложных задач. Такой подход помогает гибко распределять вычислительный бюджет под конкретные требования рабочей команды.
Особенности предварительного обучения
Процесс претрейна охватил массив из 23,8 триллиона токенов, собранных из сети, публичных репозиториев и специализированных лицензированных баз данных. Инженеры отфильтровали примерно 95% «сырого» веб-контента, сохранив при этом около 1,8 триллиона высококачественных текстовых единиц, которые обычно отсеиваются стандартными фильтрами.
Инфраструктура и стабильность обучения
В основе архитектуры лежит комбинация локального и глобального внимания с детализированными маршрутизируемыми экспертами. Балансировка нагрузки опирается на методы DeepSeek-V3 без вспомогательных потерь с добавлением косинусного затухания. Завершение предварительного этапа заняло менее четырех недель на кластере из 6144 ускорителей NVIDIA GB300 NVL72, а эффективный контекст на этапе мидтрейна был расширен до 1 миллиона токенов.
Обучение с подкреплением на высокой вычислительной мощности
Масштабирование посредством RL стало ключевым фактором развития модели. Для этого этапа задействовали 10 500 графических процессоров NVIDIA GB300 на протяжении четырех недель, сгенерировав свыше 100 миллионов траекторий (rollouts). Максимальный контекст обработки в таких прогонах достигался на отметке в 256 тысяч токенов, а проверка результатов потребовала около 1,3 миллиарда изолированных песочниц.
Асинхронные градиенты и скорость интеграции
Команда применила полностью асинхронные градиенты политики, где каждый токен маркируется версией создавшей его политики. Это обеспечило стабильность обучения даже при отставании весов на один день. Инфраструктурные показатели демонстрируют обработку 110 тысяч одновременных прогонов в среднем, причем новые веса доставлялись в инференс-флот всего за 12 секунд.
Безопасность и выравнивание
Для обеспечения надежности разработчики обучили отдельную модель безопасности на базе контрольной точки претрейна, объединив её с учителем RL через дистилляцию на политике. В процессе применялся метод осознанного выравнивания (deliberative alignment), а детальные результаты проверок безопасности вошли в официальный технический отчет.
Сравнение с конкурентами и бенчмарки
В тестах на программирование и агентские сценарии Beam демонстрирует высокие результаты. На платформе SWE-bench Verified модель набирает 80,9 балла, опережая Nemotron 3 Ultra с её 70,7 балла. В Terminal Bench v2.1 показатель составляет 80,1 балла, что приближается к уровню GLM 5.2.
Лицензирование и доступность весов
Среди сопоставимых решений разработка от Reflection AI выделяется меньшим общим объемом параметров при 23 млрд активных весов. Планируемый выпуск под лицензией Apache 2.0 сделает модель доступной для коммерческого и исследовательского использования наряду с аналогами от других технологических гигантов.
Главные выводы
Новый продукт представляет собой мощную MoE-систему с миллионным контекстом и высокой эффективностью инференса. Масштабные инвестиции в предварительное обучение и reinforcement learning позволили создать конкурентоспособное решение для сложных инженерных и агентских задач, выход которого на рынок открытых весов намечен на ближайшее время.
