Загрузка 0
ПОДЕЛИТЬСЯ

Мой блог

Листай вниз

Тестируем AI-ускоритель PPU Zhenwu 810E от Alibaba: архитектура, интерконнект и запуск LLM

Тестируем AI-ускоритель PPU Zhenwu 810E от Alibaba: архитектура, интерконнект и запуск LLM

Современный рынок ИИ-оборудования стремительно развивается, предлагая самые разные типы чипов: от классических графических процессоров до специализированных TPU и NPU. В этой статье я расскажу, как тестировал AI-ускоритель от Alibaba Group, чтобы оценить его применимость в качестве выделенного сервера или ноды для облачного Kubernetes.

Компания Chaitex предоставила нам для экспериментов специализированную AI-станцию с предустановленным программным обеспечением. Поскольку графический интерфейс управления не соответствовал нашим задачам, все тесты проводились с акцентом на интеграцию оборудования в существующую инфраструктуру. Платформа укомплектована 16 процессорами PPU Zhenwu 810E, разработанными подразделением T-HEAD корпорации Alibaba. Сама аббревиатура расшифровывается как Parallel Processing Unit и представляет собой отдельный класс вычислительных ускорителей.

Серверная AI-станция на базе процессоров PPU
Серверное решение, предоставленное для проведения тестов
Схема компиляции CUDA кода под архитектуру PPU
Схема трансляции исходного кода CUDA с использованием PPU SDK
Пример официальной технической документации на китайском языке
Оригинальная документация разработчика на китайском языке

Архитектура и характеристики PPU Zhenwu 810E

Каждый чип Zhenwu 810E укомплектован 96 ГБ памяти HBM2e с пропускной способностью около 2,77 ТБ/с. На борту сервера установлен интерфейс PCIe 5.0 x16, а общая суммарная емкость видеопамяти составляет внушительные 1536 ГБ. Для связи между чипами используется собственный межчиповый интерконнект ICN.

Реклама
Список портированных библиотек и инструментов в образе PPU SDK
Перечень адаптированных под PPU библиотек в составе контейнера
Список моделей, предлагаемых вендором в интерфейсе AI-станции
Встроенный веб-интерфейс AI-станции со списком доступных моделей

Особенности документации и программного стека

Программная экосистема PPU является суверенной: нативные инструменты NVIDIA здесь не работают. Хотя заявляется поддержка компиляции исходного кода CUDA под PPU с помощью специального SDK, все стандартные библиотеки вроде PyTorch или vLLM требуют предварительного портирования. Основной объем документации доступен на китайском языке, а англоязычные версии на глобальном портале облака часто отстают по актуальности. Готовые среды для инференса поставляются в виде специализированных Docker-образов, однако это создает определенные риски: при выходе новых версий ПО приходится ждать официальной адаптации от команды разработчиков T-HEAD.

Страница модели от T-HEAD на платформе Modelscope
Официальная страница репозитория весов модели на Modelscope
Интерфейс загрузки deb-пакетов в документации облачного сервиса
Раздел документации с инструкцией по скачиванию пакета ppu-dcgm

Что касается квантования, платформа поддерживает форматы FP32, BF16, FP16, а также схемы W8A8, AWQ и GPTQ. Производитель рекомендует использовать квантизацию W8A8, обеспечивающую оптимальный баланс между производительностью и точностью. Официальные веса моделей выкладываются на китайской платформе Modelscope, в то время как на привычном Hugging Face найти проверенные варианты от разработчиков затруднительно.

Графический интерфейс с метриками утилизации PPU
Панель мониторинга аппаратных метрик в веб-интерфейсе станции
Топология связей TPU ускорителей для демонстрации структуры
Принципиальная схема организации межчиповых соединений

Обзор сервера и диагностика

Для мониторинга состояния оборудования я использовал утилиту ppu-smi, которая является аналогом nvidia-smi. Она корректно отображает все 16 ускорителей, их рабочие частоты, температуры, энергопотребление и объемы занятой памяти. Физическая топология связи между чипами имеет сложную структуру, где каждый ускоритель задействует до семи линий ICN с пропускной способностью около 53 ГБ/с на линк.

Маркетинговое изображение архитектуры PPU
Промо-материал с визуализацией внутренних коммуникаций чипа
Сравнение характеристик интерконнекта NVLink разных поколений
Таблица сравнения пропускной способности шин NVLink 3.0 и 4.0

Тестирование сетевого интерконнекта ICN

Для оценки пропускной способности коммуникационного слоя я задействовал специальные тесты AllReduce и AlltoAll, аналогичные стандартным бенчмаркам NCCL. Замеры показали прямую зависимость производительности от топологии размещения PPU в группах. Для пар с двумя объединенными линками ICN2 скорость достигала почти 89 ГБ/с, тогда как связь через один линк ICN1 давала около 44 ГБ/с, а маршрутизация через системную шину PCIe падала до 14 ГБ/с. В тестах на группе из восьми ускорителей общая оценка эффективности составила 244 ГБ/с.

Матрица топологии соединений ppu-smi topo
Результат выполнения команды диагностики связей между устройствами
Параметры окружения по умолчанию в документации вендора
Таблица дефолтных системных переменных для корректной работы SDK

Запуск контейнеров и подготовка к инференсу

Перед запуском языковых моделей необходимо было настроить окружение внутри контейнеров. В отличие от GPU, для PPU отсутствует готовая прослойка вроде nvidia-container-toolkit, поэтому устройства пробрасываются в контейнер при помощи параметров каталога /dev и флага –device. Проверки через Python и PyTorch подтвердили успешное распознавание всех 16 доступных устройств.

Графики производительности инференса DeepSeek-v4-Flash
Результаты бенчмарков модели DeepSeek-v4-Flash при различных нагрузках

Бенчмарки модели DeepSeek-v4-Flash-0731

Тестирование проводилось по трем стандартным профилям нагрузки: Chat, RAG и Batch с разным соотношением входных и выходных токенов. Модель DeepSeek-v4-Flash-0731 удалось запустить на восьми ускорителях с использованием параллелизма тензоров. Эксперименты показали стабильную работу системы, однако при высоких значениях concurrency метрики задержек заметно возрастали.

Тепловая карта метрик производительности DeepSeek-v4-Flash
Тепловая карта распределения задержек и пропускной способности
Информационный баннер облачного сервиса Selectel
Рекламный блок облачной платформы для запуска моделей

В следующем эксперименте задействовали все 16 чипов с конфигурацией паралеллизма TP=8 и DP=2, разделив модель на две независимые группы. Полученные результаты продемонстрировали, что эффект от параллелизма данных начинает проявляться только при больших пакетах запросов, начиная примерно с concurrency от 64.

Метрики утилизации кэша KV для модели Kimi K2.6
Графики заполнения и использования KV-Cache при тестировании
Состояние очереди планировщика vLLM
График длины очереди запросов в планировщике движка инференса

Проверка моделей GLM-5.2 и Kimi K2.6

Попытка запустить полные веса модели GLM-5.2 завершилась неудачей из-за несовместимости текущего форка vLLM с архитектурой чекпоинтов. В то же время модель Kimi K2.6 в квантизации W8A8 запустилась без каких-либо затруднений. Проведенные бенчмарки показали, что при интенсивном контексте емкость KV-Cache полностью заполняется, после чего запросы начинают выстраиваться в очередь.

График времени выполнения E2E для модели Kimi K2.6
Метрики полного времени выполнения запроса end-to-end

Заключение

Рассмотренная AI-станция обладает впечатляющим объемом быстрой памяти и высокой пропускной способностью внутреннего интерконнекта. Главным ограничением на данный момент остается специфический программный стек, дефицит подробной документации и зависимость от редких обновлений со стороны производителя. Тем не менее, для стабильных корпоративных и государственных задач с фиксированным набором моделей такое железо представляет серьезный интерес.

01.