Загрузка 0
ПОДЕЛИТЬСЯ

Мой блог

Листай вниз

Cohere представила North Small Translate: модель перевода на 218B параметров с архитектурой MoE

Cohere представила North Small Translate: модель перевода на 218B параметров с архитектурой MoE

Компания Cohere совместно с исследовательским подразделением Cohere Labs анонсировала релиз открытой языковой модели North Small Translate, созданной специально для автоматического перевода. Новинка базируется на архитектуре разреженной сети с несколькими экспертами (Mixture-of-Experts, MoE) и суммарно содержит 218 миллиардов параметров, из которых при обработке каждого токена активируется 25 миллиардов.

Модель обучена работе с 50 языками, охватывая широкий спектр от албанского до вьетнамского. В рамках собственного тестирования по стандарту WMT26 разработчики зафиксировали средний результат в 83,6 балла по всем языковым парам. Как утверждает Cohere, эта цифра позволяет модели обойти специализированные переводчики вроде DeepL и Google Translate, а также универсальные открытые нейросети уровня GLM 5.2 и Mistral Large 3.

С практической точки зрения модель уже готова к интеграции: разработчики могут бесплатно обращаться к ней через API Cohere в пределах установленных лимитов, разворачивать ее на собственной инфраструктуре для некоммерческих целей или оформлять коммерческую лицензию.

Реклама

Возвращение к истокам архитектуры Transformer

В 2017 году команда исследователей Google опубликовала знаменитую работу «Attention Is All You Need», открывшую эру трансформеров. Тогда демонстрация эффективности нового подхода строилась именно на задачах машинного перевода — в частности, между английским, немецким и французским языками в бенчмарке WMT 2014. Спустя девять лет Cohere фактически возвращается к этой исходной проблематике, создавая узкоспециализированную модель большой мощности.

В официальном анонсе представители компании подчеркивают, что точность машинного перевода сегодня напрямую связана с информационным и технологическим суверенитетом организаций: структуры, не способные выстроить точные коммуникационные каналы на глобальном рынке, теряют независимость. North Small Translate стала первой моделью в специализированной линейке North, продолжив многоязычную серию разработок компании вслед за Tiny Aya и Command A Translate. Проект реализуется в партнерстве с компанией RWS: лингвисты и специалисты подразделения Language Weaver принимали непосредственное участие в тонкой настройке модели под реальные бизнес-сценарии.

Архитектура и технические особенности

Конструктивно North Small Translate представляет собой Transformer формата decoder-only с системой разреженных экспертов (sparse MoE). Я изучил инженерные особенности модели, и среди ключевых решений стоит выделить следующие:

  • Конфигурация экспертов: всего архитектура включает 128 экспертов, из которых для каждого конкретного токена выбираются 8. Дополнительно задействованы общие эксперты (shared experts), участвующие в обработке каждого токена.
  • Принцип маршрутизации (Router): выбор экспертов осуществляется через функцию Sigmoid над их логитами с последующей нормализацией по выбранной группе top-k.
  • Механизм внимания: используется чередование слоев Скользящего окна (sliding-window с шириной 4096 и позиционным кодированием RoPE) и глобальных слоев без позиционных эмбеддингов в пропорции 3:1.
  • Преемственность: подобная схема слоев внимания ранее дебютировала в модели Command A.
  • Контекстное окно: модель принимает до 16 000 токенов на входе и способна генерировать до 16 000 токенов на выходе (работа ведется исключительно с текстом).
  • Специализация обучения: этап пост-обучения (post-training) был целиком сфокусирован на грамотности, точности и стилистике перевода.

Благодаря архитектуре MoE при расчете каждого токена задействуется лишь порядка 11,5% общих весов. Вычислительные затраты на токен соответствуют уровню модели на 25 млрд параметров, однако аппаратные требования к видеопамяти остаются высокими — система должна полностью вмещать все 218 миллиардов параметров.

Тесты и результаты на бенчмарках

В официальном блоге Cohere опубликован сводный отчет о тестировании модели на наборе данных WMT26 для всех поддерживаемых языков:

Модель Средний бал WMT26
North Small Translate (Agentic) 84,36
North Small Translate 83,60
Qwen 3.5 397B A17B 81,56
DeepL NextGen 81,37
Gemma 4 31B (on) 79,46
GLM 5.2 FP8 76,50
Google Translate 68,20

Продвинутая модификация с пометкой Agentic использует многопроходный алгоритм (multi-pass workflow), позволяющий нейросети самостоятельно находить и исходить собственные ошибки в процессе генерации. Градация Cohere относит показатели от 80 до 100 баллов к категории идеального перевода либо текста с незначительными оговорками.

Реклама

Однако здесь важна одна оговорка: приведенные цифры получены в тестах самого вендора, где роль итогового судьи выполняла модель GPT-5.6-Sol. До появления независимых результатов от экспертного сообщества эти данные стоит воспринимать как показатели, заявленные разработчиком.

В региональном распределении оба варианта North продемонстрировали заметное преимущество перед Gemma 4 31B на европейских языках: 82,17 баллов против 72,73 у конкурента. В то же время на языках Южной Азии показатели оказались максимально близкими — 86,16 баллов у North против 88,04 у Gemma.

Скорость, работа с длинными текстами и экономика

На идентичном тестовом оборудовании при низкой параллельной нагрузке North Small Translate выдавала 112 выходных токенов в секунду, тогда как Gemma 4 31B показывала 81 токен. При высокой параллельной нагрузке соотношение составило 39 токенов в секунду против 30. Cohere заявляет об итоговом приросте пропускной способности до 1,4 раза.

Отдельный акцент сделан на обработке объемных документов. В тесте с одновременным переводом двух книжных глав за один запрос North набрала 48,9 баллов по метрике xCOMET-XL (оценка качества на уровне отдельных абзацев). Для сравнения, классический Google Translate получил лишь 21,3 балла, а Gemma 4 31B — 19,4 балла.

Экономические расчеты Cohere также выглядят наглядно. Выполнение стандартной задачи средним объемом в 661 токен на North оценен в $0,000676 при итоговом качестве 80,1 балла. В то же время запрос к Gemini 3.1 Pro Preview (high) обходится в $0,038928 за ту же задачу, что дороже примерно в 58 раз. Стоимость выполнения аналогичного объема на Qwen 3.5 397B A17B составляет $0,004525, а на Command A+ — $0,005158.

Как запустить и использовать модель

Самый оперативный способ протестировать инструмент — вызвать его через Cohere Chat V2 API. Модель доступна бесплатно до исчерпания стандартных лимитов:

from cohere import ClientV2

co = ClientV2(api_key="<YOUR_API_KEY>")

response = co.chat(
    model="north-small-translate-1-0",
    messages=[{
        "role": "user",
        "content": "Translate everything that follows into French:\n\nEnterprises need accurate translations of business-critical documents."
    }],
)

print(response.message.content[0].text)

Для развертывания на собственных мощностях разработчики выложили три публичных чекпоинта, совпадающих с продакшн-версиями:

Чекпоинт Требования к Blackwell Требования к Hopper
BF16 4x B200 8x H100
FP8 2x B200 4x H100
NVFP4 W4A16 1x B200 2x H100

Главные итоги

  • North Small Translate от Cohere — специализированная MoE-нейросеть перевода на 218B параметров (25B активных).
  • В тесте WMT26 модель показывает 83,6 балла в базовом режиме и 84,36 балла в агентском (Agentic).
  • Текущие результаты представлены разработчиками и получены при помощи оценки через GPT-5.6-Sol.
  • Квантованная версия NVFP4 позволяет запускать модель локально на связке из одного ускорителя B200 или двух H100.

Источник: www.marktechpost.com

01.