Мой блог
Тестируем AI-ускоритель PPU Zhenwu 810E от Alibaba: архитектура, интерконнект и запуск LLM
Современный рынок ИИ-оборудования стремительно развивается, предлагая самые разные типы чипов: от классических графических процессоров до специализированных TPU и NPU. В этой статье я расскажу, как тестировал AI-ускоритель от Alibaba Group, чтобы оценить его применимость в качестве выделенного сервера или ноды для облачного Kubernetes.
Компания Chaitex предоставила нам для экспериментов специализированную AI-станцию с предустановленным программным обеспечением. Поскольку графический интерфейс управления не соответствовал нашим задачам, все тесты проводились с акцентом на интеграцию оборудования в существующую инфраструктуру. Платформа укомплектована 16 процессорами PPU Zhenwu 810E, разработанными подразделением T-HEAD корпорации Alibaba. Сама аббревиатура расшифровывается как Parallel Processing Unit и представляет собой отдельный класс вычислительных ускорителей.



Архитектура и характеристики PPU Zhenwu 810E
Каждый чип Zhenwu 810E укомплектован 96 ГБ памяти HBM2e с пропускной способностью около 2,77 ТБ/с. На борту сервера установлен интерфейс PCIe 5.0 x16, а общая суммарная емкость видеопамяти составляет внушительные 1536 ГБ. Для связи между чипами используется собственный межчиповый интерконнект ICN.


Особенности документации и программного стека
Программная экосистема PPU является суверенной: нативные инструменты NVIDIA здесь не работают. Хотя заявляется поддержка компиляции исходного кода CUDA под PPU с помощью специального SDK, все стандартные библиотеки вроде PyTorch или vLLM требуют предварительного портирования. Основной объем документации доступен на китайском языке, а англоязычные версии на глобальном портале облака часто отстают по актуальности. Готовые среды для инференса поставляются в виде специализированных Docker-образов, однако это создает определенные риски: при выходе новых версий ПО приходится ждать официальной адаптации от команды разработчиков T-HEAD.


Что касается квантования, платформа поддерживает форматы FP32, BF16, FP16, а также схемы W8A8, AWQ и GPTQ. Производитель рекомендует использовать квантизацию W8A8, обеспечивающую оптимальный баланс между производительностью и точностью. Официальные веса моделей выкладываются на китайской платформе Modelscope, в то время как на привычном Hugging Face найти проверенные варианты от разработчиков затруднительно.


Обзор сервера и диагностика
Для мониторинга состояния оборудования я использовал утилиту ppu-smi, которая является аналогом nvidia-smi. Она корректно отображает все 16 ускорителей, их рабочие частоты, температуры, энергопотребление и объемы занятой памяти. Физическая топология связи между чипами имеет сложную структуру, где каждый ускоритель задействует до семи линий ICN с пропускной способностью около 53 ГБ/с на линк.


Тестирование сетевого интерконнекта ICN
Для оценки пропускной способности коммуникационного слоя я задействовал специальные тесты AllReduce и AlltoAll, аналогичные стандартным бенчмаркам NCCL. Замеры показали прямую зависимость производительности от топологии размещения PPU в группах. Для пар с двумя объединенными линками ICN2 скорость достигала почти 89 ГБ/с, тогда как связь через один линк ICN1 давала около 44 ГБ/с, а маршрутизация через системную шину PCIe падала до 14 ГБ/с. В тестах на группе из восьми ускорителей общая оценка эффективности составила 244 ГБ/с.


Запуск контейнеров и подготовка к инференсу
Перед запуском языковых моделей необходимо было настроить окружение внутри контейнеров. В отличие от GPU, для PPU отсутствует готовая прослойка вроде nvidia-container-toolkit, поэтому устройства пробрасываются в контейнер при помощи параметров каталога /dev и флага –device. Проверки через Python и PyTorch подтвердили успешное распознавание всех 16 доступных устройств.

Бенчмарки модели DeepSeek-v4-Flash-0731
Тестирование проводилось по трем стандартным профилям нагрузки: Chat, RAG и Batch с разным соотношением входных и выходных токенов. Модель DeepSeek-v4-Flash-0731 удалось запустить на восьми ускорителях с использованием параллелизма тензоров. Эксперименты показали стабильную работу системы, однако при высоких значениях concurrency метрики задержек заметно возрастали.


В следующем эксперименте задействовали все 16 чипов с конфигурацией паралеллизма TP=8 и DP=2, разделив модель на две независимые группы. Полученные результаты продемонстрировали, что эффект от параллелизма данных начинает проявляться только при больших пакетах запросов, начиная примерно с concurrency от 64.


Проверка моделей GLM-5.2 и Kimi K2.6
Попытка запустить полные веса модели GLM-5.2 завершилась неудачей из-за несовместимости текущего форка vLLM с архитектурой чекпоинтов. В то же время модель Kimi K2.6 в квантизации W8A8 запустилась без каких-либо затруднений. Проведенные бенчмарки показали, что при интенсивном контексте емкость KV-Cache полностью заполняется, после чего запросы начинают выстраиваться в очередь.

Заключение
Рассмотренная AI-станция обладает впечатляющим объемом быстрой памяти и высокой пропускной способностью внутреннего интерконнекта. Главным ограничением на данный момент остается специфический программный стек, дефицит подробной документации и зависимость от редких обновлений со стороны производителя. Тем не менее, для стабильных корпоративных и государственных задач с фиксированным набором моделей такое железо представляет серьезный интерес.
