Мой блог
Китайские GPU: новые решения от Huawei и Alibaba для искусственного интеллекта
Недавние презентации от Huawei и Alibaba продемонстрировали новый вектор развития китайской индустрии аппаратного обеспечения для искусственного интеллекта. Вместо прямого копирования западных архитектур разработчики из КНР сосредоточились на преодолении инфраструктурных ограничений с помощью оригинальных топологий и вертикальной интеграции.
Подобный подход позволяет создавать масштабные кластерные решения в условиях технологических барьеров, предлагая рынку специализированные суперкомпьютерные комплексы и программные стеки.




Что анонсировали Huawei
Флагманским продуктом компании стал Atlas 960E SuperPoD — первая в отрасли система такого типа, использующая технологию near-packaged optics. Данное решение объединяет тысячи ускорителей в единый вычислительный узел с общей памятью, что критически важно для эффективного обучения и работы крупных нейросетей.
Архитектурные особенности и характеристики SuperPoD
Точная конфигурация Atlas 960E насчитывает около 80 стоек, включая вычислительные модули и коммутационные блоки на базе интерфейса UnifiedBus. Единый кластер способен вмещать до 4096 ускоряющих элементов в одном блоке, обеспечивая высокие показатели производительности на пониженной разрядности.
Модификации процессоров Ascend 960
Линейка ускорителей разделена на две версии под конкретные задачи. Модель 960DT ориентирована на ресурсоемкое обучение моделей и получит 288 гигабайт памяти HBM с пропускной способностью 9,6 терабайт в секунду в первом квартале 2027 года. Версия 960PR разработана специально для инференса и предложит 192 гигабайта памяти с пропускной способностью 2,4 терабайта в секунду ближе к третьему кварталу того же года.

Параллельно компания представила серверные системы TaiShan 950 SuperPoD для процессоров общего назначения с единым пулом памяти на 256 терабайт, а также петабайтное хранилище OceanStor M900 для кэширования контекста. Программный стек CANN для чипов Ascend был переведен на модель открытого исходного кода для лучшей интеграции с популярными фреймворками.

Что анонсировали Alibaba
Подразделение T-Head Semiconductor представило чип Zhenwu V900, позиционируемый как наиболее мощный ИИ-ускоритель китайской разработки. Новинка демонстрирует трехкратное превосходство по скорости работы над предшествующей моделью M890 и поддерживает вычисления в широком диапазоне форматов точности.

Масштабирование и экосистема
Архитектура чипа включает настраиваемые размеры блоков в форматах MXFP8 и MXFP4, что стабилизирует производительность при расширении кластеров. Объединение ускорителей осуществляется с помощью фирменных коммутаторов ICN Switch, обеспечивающих масштабирование до полумиллиона карт в единой инфраструктуре.
Программная и аппаратная интеграция
В рамках единой стратегии развития облачных и аппаратных решений компания готовится выпустить суперускоритель Panjiu, объединяющий чипы V900, сетевые карты SmartNIC и контроллеры в рамках одного узла. Параллельно развивается линейка процессоров Yitian на базе RISC-V для агентных вычислений, а софтверная экосистема дополняется инструментами Agent Context и AgentCore для работы с контекстной памятью.
Кого еще мы встречали: MTT S5000 и DF1000
Рынок аппаратных решений для машинного обучения в Китае не ограничивается двумя технологическими гигантами. Другие компании предлагают альтернативные конструктивные подходы к созданию кремниевых чипов.

Альтернативные архитектурные концепции
Универсальные графические процессоры Moore Threads MTT S5000 опираются на классическую идею полной программной совместимости с популярными библиотеками вроде PyTorch без необходимости адаптации исходного кода. В то же время ускоритель Dongfang Suanxin DF1000 использует 14-нанометровый техпроцесс без высокоскоростной памяти HBM, заменяя её трехмерным стекингом по технологии near-memory для обхода производственных ограничений.
Сравнение с лидерами
Сопоставление анонсированных китайских продуктов с актуальными западными аналогами показывает разницу в текущих этапах жизненного цикла продукции. В то время как передовые решения от NVIDIA и AMD уже поставляются на рынок, многие китайские разработки пока находятся на стадии дорожных карт с планами серийного выпуска в ближайшие годы.

Сравнение на уровне чипов и стоек
Показатели плотности памяти и межчипового взаимодействия демонстрируют отставание от флагманских американских архитектур текущего поколения. Тем не менее, масштабные кластерные проекты вроде SuperPoD предлагают уникальные сетевые топологии на базе оптических модулей, хотя их реальная эффективность в производственных условиях еще требует независимого подтверждения.
Наш тест Zhenwu 810E
Практическое тестирование раннего предшественника актуальных чипов позволило выявить ряд инженерных особенностей ранних китайских ускорителей. Главные сложности при этом касались не столько базовой производительности кремния, сколько особенностей топологии межсоединений и определенной незрелости программного стека.
Проблемы интеграции и софта
Специалисты столкнулись с неравномерной пропускной способностью коммуникационных линий, отсутствием привычных инструментов контейнеризации и мониторинга уровня дата-центра, а также с дефицитом технической документации на английском языке. Это подчеркивает тот факт, что аппаратный прогресс должен подкрепляться развитой программной экосистемой.
Итог
Последние анонсы из Китая иллюстрируют стремление локальных производителей находить нестандартные обходные пути для создания мощных вычислительных систем в условиях санкционного давления. Главным критерием успешности таких систем остается их реальная производительность на реальных рабочих нагрузках в продакшене, а не только заявленные в презентациях характеристики.
