Мой блог
Архитектура NVIDIA Spectrum-X Ethernet Multiplane для масштабирования ИИ-фабрик

Архитектура сети NVIDIA Spectrum-X Ethernet Multiplane на конференции Hot Chips 2026
Компания NVIDIA представляет новую архитектуру сети NVIDIA Spectrum-X Ethernet Multiplane в рамках конференции Hot Chips 2026. Этот доклад посвящен масштабированию сетевой инфраструктуры фабрик искусственного интеллекта от тысяч графических процессоров до полумиллиона. Платформа AI Factory демонстрирует разделение инфраструктуры на пять специализированных сетей: scale-across, scale-in, scale-out, scale-up и AI context scale. Направление scale-in выделяется как новое решение, подчеркивающее, что единая универсальная фабрика не способна эффективно обслуживать все эти задачи одновременно, что и служит главным аргументом доклада. Дополнительно отмечается, что решения NVIDIA по совмещенной оптике уже запущены в серийное производство, а также обсуждаются причины необходимости внедрения технологий Astra, scale-in и процессоров BlueField-4.
Сетевая инфраструктура scale-up от NVIDIA функционирует на базе технологии NVLink. Стоечная система NVLink NVL72 объединяет коммутационные модули и коммутационные платки NVLink в единый домен масштабирования на 72 графических процессора, что обеспечивает лидирующие показатели эффективности генерации токенов на мегаватт. Сети для корпоративного сектора, гиперскейлеров и поставщиков услуг обладают уникальными конструкциями магистралей, и NVIDIA подчеркивает, что фабрики искусственного интеллекта требуют специализированного Ethernet-решения вместо применения стандартных универсальных топологий.
Платформа Spectrum-X выступает ответом компании на задачи масштабирования Ethernet гигабайтного уровня. Заявленные показатели включают в себя в 1,6 раза большую пропускную способность RDMA, в 2,2 раза улучшенную поддержку многоарендности и в 1,3 раза меньший джиттер пропускной способности при использовании коммутационных систем на 102,4 Тбит/с и сетевых адаптеров SuperNIC на 1,6 Тбит/с. Особое внимание уделяется борьбе с джиттером не на уровне отдельного устройства, а в рамках всей сквозной системы. Согласно приведенным данным, прирост производительности обучения в условиях многоарендной среды фабрики ИИ достигает 1,9 раза на основе прогонов обучения многозадачных моделей вроде DeepSeek V3. В зашумленной общей среде показатели стандартного Ethernet заметно уступают результатам Spectrum-X за счет изоляции шумов между арендаторами и минимизации задержек связи.
Наиболее ярко экстремальный кодизайн проявляется в производительности NCCL. Для ключевых операций NCCL при предварительном обучении Nemotron Ultra показатели gradient all-reduce демонстрируют 14-кратное превосходство, token dispatch увеличивается в 3,5 раза, а gradient reduce-scatter и параллельное матричное умножение — в 2 раза по сравнению с обычным коммерческим Ethernet. При этом масштабирование ИИ в горизонтальной плоскости опирается на оптику в гораздо большей степени, чем традиционные облачные решения. Доля оптических компонентов в энергопотреблении вычислительной мощности ИИ-фабрики составляет 10%, что существенно выше показателей классических облачных дата-центров. Фотонные технологии Spectrum-X Ethernet базируются на серийном производстве чипов совмещенной оптики с микрокольцевыми модуляторами и кремниево-фотонном движке с 3D-компоновкой на технологическом процессе TSMC Coupe, что обеспечивает сокращение количества лазеров в 4 раза, снижение энергопотребления и уменьшение числа сбоев в 10 раз.
Современные гиперскейл-облака обычно строятся на базе топологии коммутаторов в стойке (Top-of-Rack). Данная базовая конфигурация на 2 тысячи узлов представляет собой классический подход, от которого компания стремится уйти при создании современных ИИ-фабрик. Многорельсовая архитектура (multi-rail) становится первым шагом к такому переходу: демонстрируются конфигурации на 8 тысяч графических процессоров Rubin с пропускной способностью scale-out 1,6 Тбит/с на каждый GPU, где коммутаторы емкостью 100 Тбит/с содержат 64 порта по 1,6 Тбит/с и распределяют трафик между четырьмя независимыми линиями.
При многолинейной схеме (multi-rail) вся пропускная способность сетевого адаптера (NIC) направляется на один портовый коммутатор. Теперь компания NVIDIA внедряет мультиплоскостную топологию (multiplane topology). Ее суть заключается в том, чтобы разделить фабрику на плоскости, способные совместно использовать аппаратную часть коммутаторов, вместо выделения целых линий. В этой архитектуре сетевой адаптер подключается сразу к нескольким коммутаторам. Вместо единого канала емкостью 1,6 Тбит/с на один коммутатор применяется конфигурация из восьми линий по 200 Гбит/с, причем каждая из них ведет к отдельному устройству. Такой подход увеличивает масштаб фабрик искусственного интеллекта в 64 раза по сравнению с традиционной многолинейной организацией. В результате NVIDIA заявляет о поддержке до 512 тысяч графических процессоров Rubin при сохранении пропускной способности масштабирования на уровне 1,6 Т на один GPU. Для этого задействуются 100-терабитные коммутаторы с 512 портами по 200G, распределенными на восемь плоскостей по четырем линиям.
Мультиплоскостная структура также позволяет сократить физические затраты пространства. По данным разработчиков, она требует в 1,7 раза меньше коммутаторов для масштабирования по сравнению с классической многоуровневой однолинейной топологией, что ведет к снижению энергопотребления, экономии места в стойках и уменьшению затрат. Главный выигрыш от такого решения проявляется в поведении системы при сбоях. При частичной потере пропускной способности мультиплоскостная архитектура NVIDIA Spectrum-X сохраняет 90% производительности при времени обнаружения неполадки 2,68 миллисекунды, тогда как традиционная многоуровневая топология падает до нулевой пропускной способности. В компании подсчитали, что это дает преимущество в полезной пропускной способности (goodput) в 1,6 раза по сравнению со стандартными готовыми решениями (off-the-shelf) Ethernet аналогичного назначения. Платформа Spectrum-X обнаруживает сбои за 2,68 мс, что примерно в 400 раз быстрее стандартных аналогов, и восстанавливается за 100 мс (примерно в 11 раз быстрее), удерживая 90% пропускной способности. В то же время OTS-топология сталкивается с полной потерей данных, а ее обнаружение и восстановление занимают 1080 мс.
Архитектура Spectrum-XGS объединяет несколько центров искусственного интеллекта. Используя порты со скоростью 800 Гбит/с на коммутаторах пропускной способностью 102,4 Тбит/с и суперсетевые адаптеры ConnectX-9 SuperNIC, разработчики заявляют о снижении межсайтовой задержки до 1,9 раза и двукратном росте производительности распределенных вычислений при масштабных ИИ-операциях. Технология NVLink Fusion позволяет интегрировать сторонние ускорители XPU в общую платформу компании. Демонстрируется показатель в 3,6 ТБ/с пропускной способности «все-ко-всем» (all-to-all) на один XPU при объединении 72 таких процессоров в едином домене. Решение упаковано в бескабельную стойку MGX, рассчитанную на температуру на входе 45 градусов Цельсия и стопроцентное жидкостное охлаждение, что обеспечивает трехкратное снижение задержек.
Программное обеспечение должно успевать за развитием аппаратной базы. Платформа DSX представляет собой комплекс для искусственного интеллекта, охватывающий оптимизацию питания, инфраструктурный софт и системные компоненты, включая DSX OS, DSX Sim, DSX MaxLPS и DSX Flex. В компании утверждают, что создание подобных систем требует масштабного моделирования и проверки еще до начала физического строительства. Это становится критически важным по мере роста сетевых топологий, когда необходимо заранее понимать потребности в кабельной инфраструктуре. Инструмент DSX Air сокращает сроки развертывания с месяцев до считанных дней. Согласно презентации, подготовка инфраструктуры сокращается с полугода до одной недели, настройка софта — с трех месяцев до недели, а финальное развертывание — с двух недель до одного дня.
Пять измерений сетевой инфраструктуры ИИ
В завершении обзора аппаратных платформ выделяются пять ключевых сетевых инфраструктур современной фабрики ИИ: масштабирование внутрь (scale-in), масштабирование вверх (scale-up), масштабирование наружу (scale-out), масштабирование сквозь сети (scale-across) и контекстное масштабирование (context scale). Каждое из этих направлений обеспечивается специализированными кремниевыми чипами, а общая схема демонстрирует многократное превосходство по пропускной способности, интенсивности пакетов, задержкам и джиттеру. Каждый рассмотренный сетевой аспект создан целенаправленно и спроектирован совместно с платформой, а не заимствован из универсальных сетевых фабрик. Именно эта сквозная идея проходит через всю концепцию.
Заключительные соображения
Эксперты NVIDIA доказывают, что технология Ethernet способна эффективно справляться с задачами масштабирования ИИ-фабрик, но лишь в том случае, если аппаратное обеспечение создано специально под нужды искусственного интеллекта. Представленная мультиплоскостная топология выступает ключевым элементом, расширяющим адресный масштаб с 8 тысяч до 512 тысяч графических процессоров при меньшем числе коммутаторов и повышенной отказоустойчивости. Насколько эти показатели оправдают себя в реальных условиях эксплуатации, покажет практика, а дальнейшее развитие событий продемонстрирует, как именно складывается единая экосистема программного обеспечения и оптических решений Vera Rubin.
Источник: servethehome.com

