Загрузка 0
ПОДЕЛИТЬСЯ

Мой блог

Листай вниз

Как Z.ai запустила инференс GLM-5.3-Flash на 100 000 китайских ускорителях

Как Z.ai запустила инференс GLM-5.3-Flash на 100 000 китайских ускорителях

Создание промышленной инфраструктуры для выполнения крупных нейросетевых моделей — одна из самых сложных задач современных дата-центров. Компания Z.ai опубликовала разбор собственного технического кейса: инженерной группе удалось с нуля построить рабочую систему инференса для мультимодальной модели GLM-5.3-Flash на кластере, объединяющем более 100 000 ускорителей китайского производства. Что особенно примечательно, ключевую роль в наладке и профилировании кода сыграл не только штат разработчиков, но и специализированный ИИ-агент Infra Agent на базе самой GLM-5.3.

Масштабирование на 100 000 чипах: специфика и вызовы

В этом разделе рассматривается «Масштабирование на 100 000 чипах: специфика и вызовы». Это помогает связать предыдущую часть материала со следующим вопросом и последовательно раскрыть тему без потери важного контекста.

Архитектура GLM-5.3-Flash и первичные нагрузки

Модель GLM-5.3-Flash дебютировала в конце августа 2026 года в качестве первого нативно мультимодального решения в линейке GLM-5. Архитектура объединяет 320 миллиардов общих параметров и 18 миллиардов активных параметров за счет гибридной системы разреженного (sparse) и линейного внимания (linear attention). На этапе предварительного тестирования под псевдонимом ox-alpha на платформах OpenCode и OpenRouter нейросеть продемонстрировала колоссальный спрос, обработав свыше 62 триллионов токенов всего за первые шесть дней работы.

Реклама

Однако перевод такого масштаба в постоянную промышленную эксплуатацию столкнулся с серьезными барьерами. Запуск суперкомпьютерного кластера на 100 000 альтернативных чипах ранее не производился никем в индустрии. Инженеры Z.ai столкнулись с комплексом ограничений: относительно невысокой пропускной способностью и объемом накристальной памяти, незрелостью экосистемы ПО, нестандартной архитектурой самой модели, контекстным окном в 1 миллион токенов и высокой долей мультимодальных запросов. Во многих случаях разработчикам приходилось буквально угадывать поведение низкоуровневых операций из-за неполной документации и отсутствия готовых оптимизированных кернелов.

Схема метода плотной обратной связи Z.ai
Метод плотной обратной связи связывает логи, метрики и кернелы в единую систему автоматической отладки.

Метод плотной обратной связи (Dense Feedback Method)

При отладке распределенного инференса классический подход сталкивается с фундаментальной проблемой: сквозные метрики (end-to-end) показывают лишь факт ухудшения работы, но не дают ответа о причинах. Например, если пропускная способность падает на 20%, а время до выдачи первого токена (time-to-first-token) возрастает на 30%, метрика верхнего уровня не укажет, какой именно слой модели или участок C++-кода дал сбой.

Чтобы предоставить ИИ-агенту возможность самостоятельно искать и исправлять ошибки, Z.ai разработала методику «плотной обратной связи» (dense feedback). Она сводит в единый воспроизводимый контур тесты вычислительной точности, логи времени выполнения, трассировки вызовов, событийно-временные маркеры, микробенчмарки и глобальные метрики производительности. Это позволяет тестировать гипотезы локально, не перезапуская полный нагрузочный тест всей системы после каждого изменения кода.

Разработчики сформировали три ключевых требования к плотной обратной связи:

  • Локальность: привязка данных к конкретным кернелам, потокам, параметрам запуска, веткам кода или интервалам исполнения.
  • Низкая стоимость и скорость получения: обратный отклик должен формироваться за секунды или минуты, а не часы.
  • Объективная верификация: обязательное сравнение с эталонными реализациями и проведение контролируемых экспериментов для исключения ложных корреляций.

В этой схеме роли распределялись четко: инженеры-человека задавали целевые границы, архитектуру и контролировали критические участки (точность вычислений, параллелизм вызовов, риски сбоя продакшена), а ИИ-агент брал на себя рутинный анализ трассировок, выдвижение гипотез и написание патчей. Итоговый программный стек объединил внутриузловой тензорный параллелизм для линейного внимания и LM Head, алгоритмы ReplaySSM, квантование W8A8, смешанную точность INT8/FP8/BF16 для KV-кэша, а также схему Layer Split в рамках деагрегированной архитектуры Encode-Prefill-Decode.

Три практических кейса оптимизации системы

В этом разделе рассматривается «Три практических кейса оптимизации системы». Это помогает связать предыдущую часть материала со следующим вопросом и последовательно раскрыть тему без потери важного контекста.

Кейс 1: Точность вычислений и устранение погрешности KDA-кернела

Первый инженерный эпизод касается корректности математических операций. Сравнение распараллеленных и монолитных путей выполнения показало накопление вычислительной погрешности в KDA-кернеле на этапе контекстного параллелизма (Context Parallelism). Операция tl.dot по умолчанию использовала формат TF32 даже при подаче входных данных в FP32, из-за чего на длинных контекстах погрешность объединения состояний прогрессивно увеличивалась.

Реклама

Решением стал явный перевод вычислений на аффинную цепочку tf32x3, которая выполняет три операции TF32 на тензорных ядрах для достижения высокой точности. Соответствующие изменения были отправлены в репозиторий Flash Linear Attention (PR от 27 августа 2026 года). Патч добавил режим повышающей точности для сборки состояний, тесты контекстного параллелизма и автоматический откат к IEEE-точности на оборудовании без поддержки TF32 (процессоры AMD, сторонние NPU и видеокарты NVIDIA старше архитектуры Ampere).

Кейс 2: Устранение блокировок GIL при передаче KV-кэша

Второй кейс был связан с узким местом при параллельном переносе данных KV-кэша. Инженеры установили жесткий критерий: фаза Prefill вместе с передачей KV Transfer не должна уступать изолированной фазе Prefill более чем на 5%. Однако ИИ-агент зафиксировал просадки производительности более 20%.

Анализ трассировок показал проблему в библиотеке DeepEP v1.2.1. Функции внутриузлового распределения (dispatch) и объединения (combine) не освобождали глобальную блокировку интерпретатора Python (GIL). В результате поток Mooncake Transfer не мог вовремя получить доступ к GIL для отправки задач передачи данных, сопряжение сетевого обмена с вычислениями нарушалось. После того как в C++-коде открыли освобождение GIL на время исполнения операций, накладные расходы передачи упали ниже 1% от базового уровня.

Кейс 3: Дистилляция скелетов оптимизации и ускорение декодирования

Третий кейс затронул оптимизацию низкоуровневых кернелов. Z.ai обучила агента извлекать эффективные приемы из существующих открытых проектов (SGLang, Flash Linear Attention, DeepGEMM) и формировать универсальные «скелеты оптимизации» с описанием условий применимости и ограничений ресурсов.

Применительно к KDA Decode кернелу агент сначала переписал математические операции деления, уменьшив время исполнения на 9,6%. Затем, когда плотная обратная связь указала на вычислительную загруженность как основной блокер, агент объединил тайлы V-измерения (ранее четырежды повторявшие нормализацию FP32 и гейтинг) в один тред-блок. Сохранение промежуточных результатов в регистрах и использование warp-level редукции дало итоговый прирост скорости в 1,71 раза по сравнению с исходным кодом.

Итоговые показатели и границы рекурсивного самообучения

Благодаря связке работы инженеров и ИИ-агента весь процесс — от первичной адаптации GLM-5.3-Flash под чипы до полноценного промышленного релиза — занял менее двух недель. Сквозная пропускная способность сервиса выросла в три раза по сравнению с первоначальной базовой версией. Коэффициент полезного использования аппаратных ресурсов и стоимость обработки токена достигли показателей, сравнимых со стандартными кластерами на базе ускорителей NVIDIA.

В Z.ai подчёркивают, что этот проект стал наглядным примером частичного рекурсивного самосовершенствования: нейросеть непосредственно участвовала в оптимизации программного окружения, на котором сама же и исполняется. Впрочем, разработчики оговариваются: до полного автономного самоулучшения ещё далеко. Формулирование целей, ограничений и оценка критических рисков остаются задачами, требующими прямого участия человека.

Источник: www.unite.ai

Реклама
01.