Загрузка 0
ПОДЕЛИТЬСЯ

Мой блог

Листай вниз

DeepSeek-V4.1-Flash в API Baseten: архитектура Causal Encoder-Decoder и контекстное окно на 1 млн токенов

DeepSeek-V4.1-Flash в API Baseten: архитектура Causal Encoder-Decoder и контекстное окно на 1 млн токенов

Платформа Baseten объявила об интеграции новой мультимодальной нейросети DeepSeek-V4.1-Flash в линейку своих Model APIs. Модель построена на архитектуре Mixture-of-Experts (MoE) с суммарным объемом 552 миллиарда параметров. Главной особенностью релиза стало внедрение асимметричной схемы активных параметров: во время фазы обработки входного текста (prefill) задействуется 8 миллиардов параметров, а на этапе генерации (decode) — 16 миллиардов. Модель поддерживает полноценную работу с контекстным окном объемом до 1 миллиона токенов.

Официальный релиз открытых весов от команды DeepSeek состоялся 9 сентября 2026 года на площадке Hugging Face, после чего 11 сентября сервис Baseten добавил поддержку модели в свою инфраструктуру. Нейросеть распространяется под свободной лицензией MIT и способна принимать на вход как текстовую информацию, так и графические изображения, генерируя в качестве ответа структурированный текст. Для компании DeepSeek это уже третьих открытый релиз серии Flash за 2026 год и первая масштабная модель, в которой реализована нестандартная архитектура Causal Encoder-Decoder. Представители Baseten также сообщили, что в ближайшее время ожидается появление поддержки V4.1-Flash в их фирменном инструменте для дообучения Baseten Loops.

Тестирование и результаты в бенчмарках

Согласно предоставленной технической документации (model card), при максимальном уровне рассуждений (параметр reasoning effort установлен на значение 100) новая модель демонстрирует ощутимый прирост производительности по сравнению с предшественниками и конкурентами:

Реклама
Технические характеристики и параметры DeepSeek-V4.1-Flash
Модель DeepSeek-V4.1-Flash использует 552 млрд параметров с динамической активацией для этапов prefill и decode.
  • Terminal-Bench 2.1: версия V4.1-Flash набрала 90.6 балла, тогда как прошлый V4-Flash показал 82.7, а более тяжелый V4-Pro — 87.9.
  • DeepSWE v1.1: результат составил 74.2 балла (против 54.4 у V4-Flash и 62.7 у V4-Pro).
  • AutomationBench: новинка показала 54.8 балла, перегнав V4-Flash (37.7) и V4-Pro (43.2).

Инженеры Baseten отдельно подчеркивают успешность модели в написании кода и решении агентских задач: V4.1-Flash уверенно обходит прошлую флагманскую версию V4-Pro, обходясь при этом примерно одной третьей частью от ее общего количества параметров. Однако я бы рекомендовал учитывать важную оговорку: показатель 54.8 на AutomationBench указывает на то, что модель всё еще ошибается примерно в половине сложных сценариев автоматизации. Поэтому при проектировании автономных агентов крайне важно оставлять человека в контуре управления (human-in-the-loop).

В тестах на сложную аналитику и математику при максимальной нагрузке модель показала следующие результаты:

  • Бенчмарк GPQA Diamond: 90.9 балла;
  • Рейтинг на спортивной платформе программирования Codeforces: 3471 пункт;
  • Тест сложных задач с вызовом внешних инструментов HLE (Humanity’s Last Exam): 63.9 балла.

Отдельного внимания заслуживает обработка visual-данных. DeepSeek-V4.1-Flash стала первой стабильной (не экспериментальной) моделью разработчиков с нативной поддержкой изображений — ранее эти функции тестировались в сборке V4-Flash-Vision-Exp. В бенчмарке Chartography новинка набрала 78.9 балла против 64.3 у экспериментальной версии, а в тесте ZeroBench показатель вырос с 35.0 до 49.0 баллов.

Архитектура Causal Encoder-Decoder и оптимизация KV-кэша

Разработчики внесли фундаментальные изменения в устройство нейросети. Transformer-блок из 40 слоев разделен на 20 слоев причинного кодировщика (causal encoder) и 20 слоев декодера. Глобальный ключ-значение кэш (KV cache) для декодера формируется путем проекции скрытых состояний последнего слоя кодировщика, а не вычисляется заново на каждом слое декодера.

Такое решение позволило реализовать асимметрию: 8 млрд активных параметров на стадии обработки промпта и 16 млрд на стадии ответа. Для сравнения, предыдущий V4-Flash задействовал по 13 млрд параметров на обоих этапах. На мой взгляд, это очень практичный подход: перенос вычислительной нагрузки с prefill на decode существенным образом снижает итоговую стоимость вызовов для программных агентов, которые генерируют огромные массивы входных токенов при относительно коротких ответах.

Реклама

Среди других важных инженерных решений стоит выделить:

  • Compressed Sparse Attention 2 (CSA2): каждый слой внимания статически переводится в один из трех режимов — Full, Reindex или Reuse. Специальный иерархический индексатор Hierarchical Sparse Indexer в декодере ограничивает затраты на глубокое индексирование вне зависимости от длины контекста.
  • Квантование KV-кэша в FP4: объем памяти для хранения глобального KV-кэша сократился до 890 байт на токен, что составляет лишь четверть от показателей V4-Flash.
  • Механизм SWA Bounded Replay: восстанавливает недостающие состояния скользящего окна внимания (sliding-window attention) за счет повторного воспроизведения только самых свежих токенов. Это уменьшило постоянный след в памяти до 1/8 от прежнего объема.

По данным DeepSeek, суммарная оптимизация позволила снизить требования к видеопамяти (HBM) в 4 раза, а потребность в хранилище SSD — в 8 раз по сравнению с прошлым поколением. Модель содержит 1 общий эксперт и 384 маршрутизируемых эксперта (по 6 активных на токен в каждом MoE-слое), а также укомплектована системой условной памяти Engram на 196 млрд параметров и спекулятивным декодированием DSpark.

Обучение проходило с нуля на мультимодальном датасете объемом 45 триллионов токенов. Разреженное внимание тренировалось на последовательностях длиной 64K токенов, а расширение контекста до 1 миллиона токенов производилось на отметке в 34 триллиона токенов. Процесс пост-обучения включает стандартную цепочку из SFT, RL и дистилляции (on-policy distillation), причем основной упор был сделан на автоматический синтез агентских задач и окружений. Пользоветелям доступна гибкая настройка интенсивности рассуждений от 1 до 100.

Обновление API DeepSeek и инфраструктура Baseten

С выходом новинки DeepSeek официально вывела из эксплуатации модели V4-Flash и V4-Flash-Vision-Exp. Все запросы к старым ручкам API автоматически перенаправляются на V4.1-Flash для сохранения совместимости. Новые тарифные сетки вступили в силу 10 сентября 2026 года в 04:00 UTC, причем в непиковые часы действуют скидки до 50%. Полную интеграцию с моделью уже подтвердили партнерские сервисы WorkBuddy (включая CodeBuddy) и OpenCode.

На стороне Baseten развертывание осуществляется через стек Inference Stack с использованием библиотеки NVIDIA Dynamo. Инфраструктура умеет маршрутизировать запросы с учетом состояния KV-кэша: система отправляет новый запрос именно на тот GPU-репликат, где уже сохранен соответствующий префикс контекста, а не просто на случайную свободную карту. Модель доступна в каталоге Baseten Model Library с возможностью выделения изолированных мощностей под корпоративные нужды.

Кроме того, с 14 сентября 2026 года все запросы к эндпоинтам deepseek-v4-pro также временно перенаправляются на V4.1-Flash по ценам V4.1-Flash. Этот режим сохранится до официального релиза V4.1-Pro. В независимых тестах новая модификация Flash опережает прежнюю Pro-версию не только по точности, но и по скорости работы, общему времени выполнения задач и экономической эффективности.

Источник: www.unite.ai

01.