Мой блог
Cohere представила North Small Translate: модель перевода на 218B параметров с архитектурой MoE
Компания Cohere совместно с исследовательским подразделением Cohere Labs анонсировала релиз открытой языковой модели North Small Translate, созданной специально для автоматического перевода. Новинка базируется на архитектуре разреженной сети с несколькими экспертами (Mixture-of-Experts, MoE) и суммарно содержит 218 миллиардов параметров, из которых при обработке каждого токена активируется 25 миллиардов.
Модель обучена работе с 50 языками, охватывая широкий спектр от албанского до вьетнамского. В рамках собственного тестирования по стандарту WMT26 разработчики зафиксировали средний результат в 83,6 балла по всем языковым парам. Как утверждает Cohere, эта цифра позволяет модели обойти специализированные переводчики вроде DeepL и Google Translate, а также универсальные открытые нейросети уровня GLM 5.2 и Mistral Large 3.
С практической точки зрения модель уже готова к интеграции: разработчики могут бесплатно обращаться к ней через API Cohere в пределах установленных лимитов, разворачивать ее на собственной инфраструктуре для некоммерческих целей или оформлять коммерческую лицензию.
Возвращение к истокам архитектуры Transformer
В 2017 году команда исследователей Google опубликовала знаменитую работу «Attention Is All You Need», открывшую эру трансформеров. Тогда демонстрация эффективности нового подхода строилась именно на задачах машинного перевода — в частности, между английским, немецким и французским языками в бенчмарке WMT 2014. Спустя девять лет Cohere фактически возвращается к этой исходной проблематике, создавая узкоспециализированную модель большой мощности.
В официальном анонсе представители компании подчеркивают, что точность машинного перевода сегодня напрямую связана с информационным и технологическим суверенитетом организаций: структуры, не способные выстроить точные коммуникационные каналы на глобальном рынке, теряют независимость. North Small Translate стала первой моделью в специализированной линейке North, продолжив многоязычную серию разработок компании вслед за Tiny Aya и Command A Translate. Проект реализуется в партнерстве с компанией RWS: лингвисты и специалисты подразделения Language Weaver принимали непосредственное участие в тонкой настройке модели под реальные бизнес-сценарии.
Архитектура и технические особенности
Конструктивно North Small Translate представляет собой Transformer формата decoder-only с системой разреженных экспертов (sparse MoE). Я изучил инженерные особенности модели, и среди ключевых решений стоит выделить следующие:
- Конфигурация экспертов: всего архитектура включает 128 экспертов, из которых для каждого конкретного токена выбираются 8. Дополнительно задействованы общие эксперты (shared experts), участвующие в обработке каждого токена.
- Принцип маршрутизации (Router): выбор экспертов осуществляется через функцию Sigmoid над их логитами с последующей нормализацией по выбранной группе top-k.
- Механизм внимания: используется чередование слоев Скользящего окна (sliding-window с шириной 4096 и позиционным кодированием RoPE) и глобальных слоев без позиционных эмбеддингов в пропорции 3:1.
- Преемственность: подобная схема слоев внимания ранее дебютировала в модели Command A.
- Контекстное окно: модель принимает до 16 000 токенов на входе и способна генерировать до 16 000 токенов на выходе (работа ведется исключительно с текстом).
- Специализация обучения: этап пост-обучения (post-training) был целиком сфокусирован на грамотности, точности и стилистике перевода.
Благодаря архитектуре MoE при расчете каждого токена задействуется лишь порядка 11,5% общих весов. Вычислительные затраты на токен соответствуют уровню модели на 25 млрд параметров, однако аппаратные требования к видеопамяти остаются высокими — система должна полностью вмещать все 218 миллиардов параметров.
Тесты и результаты на бенчмарках
В официальном блоге Cohere опубликован сводный отчет о тестировании модели на наборе данных WMT26 для всех поддерживаемых языков:
| Модель | Средний бал WMT26 |
|---|---|
| North Small Translate (Agentic) | 84,36 |
| North Small Translate | 83,60 |
| Qwen 3.5 397B A17B | 81,56 |
| DeepL NextGen | 81,37 |
| Gemma 4 31B (on) | 79,46 |
| GLM 5.2 FP8 | 76,50 |
| Google Translate | 68,20 |
Продвинутая модификация с пометкой Agentic использует многопроходный алгоритм (multi-pass workflow), позволяющий нейросети самостоятельно находить и исходить собственные ошибки в процессе генерации. Градация Cohere относит показатели от 80 до 100 баллов к категории идеального перевода либо текста с незначительными оговорками.
Однако здесь важна одна оговорка: приведенные цифры получены в тестах самого вендора, где роль итогового судьи выполняла модель GPT-5.6-Sol. До появления независимых результатов от экспертного сообщества эти данные стоит воспринимать как показатели, заявленные разработчиком.
В региональном распределении оба варианта North продемонстрировали заметное преимущество перед Gemma 4 31B на европейских языках: 82,17 баллов против 72,73 у конкурента. В то же время на языках Южной Азии показатели оказались максимально близкими — 86,16 баллов у North против 88,04 у Gemma.
Скорость, работа с длинными текстами и экономика
На идентичном тестовом оборудовании при низкой параллельной нагрузке North Small Translate выдавала 112 выходных токенов в секунду, тогда как Gemma 4 31B показывала 81 токен. При высокой параллельной нагрузке соотношение составило 39 токенов в секунду против 30. Cohere заявляет об итоговом приросте пропускной способности до 1,4 раза.
Отдельный акцент сделан на обработке объемных документов. В тесте с одновременным переводом двух книжных глав за один запрос North набрала 48,9 баллов по метрике xCOMET-XL (оценка качества на уровне отдельных абзацев). Для сравнения, классический Google Translate получил лишь 21,3 балла, а Gemma 4 31B — 19,4 балла.
Экономические расчеты Cohere также выглядят наглядно. Выполнение стандартной задачи средним объемом в 661 токен на North оценен в $0,000676 при итоговом качестве 80,1 балла. В то же время запрос к Gemini 3.1 Pro Preview (high) обходится в $0,038928 за ту же задачу, что дороже примерно в 58 раз. Стоимость выполнения аналогичного объема на Qwen 3.5 397B A17B составляет $0,004525, а на Command A+ — $0,005158.
Как запустить и использовать модель
Самый оперативный способ протестировать инструмент — вызвать его через Cohere Chat V2 API. Модель доступна бесплатно до исчерпания стандартных лимитов:
from cohere import ClientV2
co = ClientV2(api_key="<YOUR_API_KEY>")
response = co.chat(
model="north-small-translate-1-0",
messages=[{
"role": "user",
"content": "Translate everything that follows into French:\n\nEnterprises need accurate translations of business-critical documents."
}],
)
print(response.message.content[0].text)
Для развертывания на собственных мощностях разработчики выложили три публичных чекпоинта, совпадающих с продакшн-версиями:
| Чекпоинт | Требования к Blackwell | Требования к Hopper |
|---|---|---|
| BF16 | 4x B200 | 8x H100 |
| FP8 | 2x B200 | 4x H100 |
| NVFP4 W4A16 | 1x B200 | 2x H100 |
Главные итоги
- North Small Translate от Cohere — специализированная MoE-нейросеть перевода на 218B параметров (25B активных).
- В тесте WMT26 модель показывает 83,6 балла в базовом режиме и 84,36 балла в агентском (Agentic).
- Текущие результаты представлены разработчиками и получены при помощи оценки через GPT-5.6-Sol.
- Квантованная версия NVFP4 позволяет запускать модель локально на связке из одного ускорителя B200 или двух H100.
Источник: www.marktechpost.com
