Загрузка 0
ПОДЕЛИТЬСЯ

Мой блог

Листай вниз

Разбор DeepSeek R1: как китайская нейросеть изменила рынок искусственного интеллекта

Разбор DeepSeek R1: как китайская нейросеть изменила рынок искусственного интеллекта

В январе 2025 года индустрия искусственного интеллекта пережила настоящий шок. В то время как ведущие американские корпорации анонсировали многомиллиардные инвестиции в дата-центры и закупку оборудования, небольшая китайская лаборатория DeepSeek опубликовала модель R1 под открытой лицензией MIT. Этот релиз вызвал не просто резонанс среди инженеров, а спровоцировал серьезную реакцию на глобальном финансовом рынке. Акции компании Nvidia за один день потеряли 17% стоимости, что составило около 589 миллиардов долларов капитализации, а индекс Nasdaq просел на 3%. Суммарное падение котировок технологического сектора превысило триллион долларов.

Приложение DeepSeek быстро возглавило американский сегмент App Store, обгнав ChatGPT. Паника инвесторов строилась на переосмыслении фундаментального тезиса: раньше считалось, что абсолютное превосходство в количестве графических чипов создает непреодолимый барьер для конкурентов. Однако китайские инженеры доказали, что благодаря грамотной алгоритмической оптимизации можно получать топовые результаты на существенно более скромном оборудовании.

Инфраструктура суперкомпьютерных кластеров High-Flyer
Собственные кластеры Fire-Flyer стали основой для быстрого обучения моделей DeepSeek.
Разработка на низкоуровневом языке PTX для GPU Nvidia
Переход с CUDA на PTX позволил вручную распределить нагрузки внутри чипов H800.
График стоимости и сравнения инференса DeepSeek R1 и OpenAI o1
Себестоимость обработки токенов в DeepSeek R1 оказалась в 27 раз ниже, чем у конкурентов.
Публикация статьи о DeepSeek R1 в научном журнале Nature
DeepSeek R1 стала первой крупной LLM, прошедшей рецензирование и попавшей на обложку Nature.
Запуск серверов для Telegram ботов на внутренней инфраструктуре
Telegram запускает бета-тестирование прямого исполнения ботов на своих серверах.

Чтобы понять, откуда появилась эта команда, стоит взглянуть на её историю. DeepSeek — это не привычный кремниевый стартап, а исследовательское подразделение квантового хедж-фонда High-Flyer из Ханчжоу. Основатель фонда Лян Вэньфэн вместе со своими сокурсниками по Чжэцзянскому университету заложил основу компании ещё в 2016 году. Фонд успешно занимался алгоритмической торговлей на основе глубокого обучения и заранее строил собственную инфраструктуру: в 2019 году был запущен кластер Fire-Flyer I, а в 2021 году — Fire-Flyer II почти на 10 000 ускорителях Nvidia A100. Закупка чипов состоялась незадолго до введения жестких торговых ограничений со стороны США.

Реклама
Лян Вэньфэн основатель High-Flyer и DeepSeek
Лян Вэньфэн — основатель квантового хедж-фонда High-Flyer и исследовательского центра DeepSeek.

В весной 2023 года High-Flyer объявил о создании отдельной лаборатории для разработок в области общего искусственного интеллекта (AGI), а летом заблокировал юридическое лицо DeepSeek. Финансирование полностью закрывалось ресурсами фонда без участия сторонних венчурных инвесторов. Выходу модели R1 предшествовала планомерная работа: в конце 2023 года вышли DeepSeek Coder и DeepSeek LLM 67B, весной 2024 года — V2 с новой архитектурой внимания, а в конце года — версия V3.

Базовым условием для инженеров стали жесткие аппартные рамки. Из-за санкций лаборатория была вынуждена использовать ускорители Nvidia H800 — урезанную версию H100 с пропускной способностью шины NVLink на уровне 400 ГБ/с вместо стандартных 900 ГБ/с. Именно дефицит коммуникационной пропускной способности заставил команду переписать классические алгоритмы обучения и инференса.

Реклама
Схема работы механизма Multi-head Latent Attention MLA
Архитектура MLA позволяет экономить память видеокарты за счет сжатия KV-кэша.

Технические решения и архитектурные инновации

Каждое инженерное новшество DeepSeek стало ответом на конкретное узкое место вычислительной системы.

1. Архитектура сжатия внимания MLA (Multi-head Latent Attention). При сгенерированном ответе стандартная модель удерживает в памяти карт KV-кэш прочитанного контекста. С увеличением длины промпта кэш занимает огромный объем памяти, ограничивая число обслуживаемых пользователей. В MLA кэш хранится в сжатом векторном виде и восстанавливается непосредственно во время вычислений. Это позволило сократить объем занимаемой памяти под кэш до единиц процентов от нормы и разместить на одной карте в разы больше параллельных запросов.

Схема архитектуры DeepSeekMoE с распределением экспертов
В DeepSeekMoE на каждый токен активируется только 37 миллиардов параметров из 671 млрд.

2. Разреженная архитектура экспертов DeepSeekMoE. Из 671 миллиарда параметров модели для обработки конкретного токена привлекается только 37 миллиардов. Специальный роутер распределяет токены по узким экспертам, подключая также общие постоянные блоки. Чтобы роутер не перегружал отдельных «любимых» экспертов, инженеры вместо классических штрафных функций применили динамическую корректировку смещений. Это позволило сбалансировать нагрузку без ухудшения целевой метрики обучения.

3. Сквозное обучение в формате FP8. Если обычно языковые модели обучают в 16-битной точности и сжимают до 8 бит только на стадии готовности, то DeepSeek проводила весь цикл обучения в FP8 с самого начала. Высокая точность сохранялась лишь в узких узлах, критичных для сходимости. Это снизило вдвое объем пересылаемых данных между серверами кластера.

Реклама
Схема конвейерной оптимизации DualPipe
Алгоритм DualPipe совмещает вычисления и сетевой обмен данными для устранения простоев чипов.

4. Конвейерная асинхронность DualPipe. В больших вычислительных системах карты часто простаивают в ожидании данных от соседних узлов. Алгоритм DualPipe совмещает расчеты и передачу данных по сети: пока графический чип вычисляет один фрагмент батча, параллельно осуществляется прием и передача следующего.

Сравнение алгоритмов обучения GRPO и PPO
Метод GRPO убирает модель-критик, существенно сокращая требования к памяти при RL-обучении.

5. Прямая оптимизация на уровне ассемблера PTX. Вместо использования стандартного высокоуровневого фреймворка CUDA команда спустилась на уровень инструкций PTX для видеокарт Nvidia. Разработчики вручную перераспределили вычисления и сетевые операции между ядрами чипа, полностью исключив простои на медленном интерконнекте.

На финальный прогон базовой модели V3 потребовалось 2,788 млн GPU-часов на картах H800, что при стоимости около $2 за час дает сумму в $5,576 млн. Именно эта цифра породила громкие заголовки про «обучение за 6 миллионов долларов». Однако важно сделать техническую оговорку: это расходы только на итоговую итерацию. В них не входят предварительные исследования, неудачные гипотезы, подготовка датасетов, оплата труда инженеров и амортизация оборудования. Совокупные вложения структуры оцениваются экспертами SemiAnalysis в сумму порядка $1,6 млрд.

Для получения рассуждающей модели R1 поверх V3 были реализованы еще две важные технологии:

  • GRPO вместо PPO: из алгоритма RL-обучения исключили отдельную модель-критик (value-model), сожиравшую до половины памяти пайплайна. Оценка эффективности генерируется относительно группы сэмплов на один промпт.
  • Метод R1-Zero: чистое обучение подкреплением без предварительной фазы размеченных цепочек рассуждений (SFT). Модель самостоятельно научилась тратить больше токенов на самопроверку и детальный анализ сложного текста.

Стратегические и бизнес-решения

Успех проекта обусловлен не только алгоритмами, но и продуманной бизнес-моделью:

  • Открытое распространение весов. Не имея доступа к американскому рынку через прямые продажи или корпоративные партнерства, компания опубликовала веса под лицензией MIT. Это обеспечило моментальную интеграцию модели в стеки разработчиков по всему миру.
  • Радикально низкая стоимость инференса. Цена в $0,55 за 1 млн входных и $2,19 за 1 млн выходных токенов оказалась в 27 раз ниже, чем у проприетарной модели OpenAI o1. Это результат сниженной себестоимости вычислений за счет MLA и MoE.
  • Отсутствие давления венчурных инвесторов. Финансирование из средств хедж-фонда избавило команду от необходимости показывать быстрый коммерческий результат, соблюдать квартальные KPI и менять роадмап в угоду инвесторам.
  • Кадровая политика и научное рецензирование. Ставка была сделана на молодых исследователей из китайских университетов и плоскую организационную структуру. А в сентябре 2025 года статья о DeepSeek R1 прошла независимый peer-review и попала на обложку журнала Nature.

Итоги и влияние на рынок AI

Релиз DeepSeek R1 окончательно изменил отношение разработчиков к open-source архитектурам. Модели с открытыми весами больше не воспринимаются как компромиссное решение для экономии. Они дают продуктовым командам то, чего не может предоставить закрытый API: полное сохранение приватности данных, возможность тонкой донастройки под конкретный домен и независимость от тарифной политики вендоров.

Боты на серверах Telegram уже доступны — подайте заявку в бету

Разработчикам ботов для Telegram стоит обратить внимание на важное обновление инфраструктуры. Похоже, мессенджер начинает постепенно разворачивать бета-тестирование функции запуска ботов непосредственно на серверах Telegram. Это позволит запускать логику без аренды сторонних VPS, сборки Docker-контейнеров и настройки внешних вебхуков — вся обработка сможет происходить внутри экосистемы.

Источник: habr.com

01.