Мой блог
Broadcom представила детали архитектуры сетевого адаптера Thor Ultra Ethernet NIC на Hot Chips 2026

Компания Broadcom представила на конференции Hot Chips сетевой адаптер Thor Ultra Ethernet NIC, ориентированный на инфраструктуру искусственного интеллекта и высокопроизводительных вычислений (HPC) со скоростью передачи данных 800 Гбит/с. Хотя семейство Thor Ultra было анонсировано ранее в этом году, данная сессия позволила подробнее изучить особенности его архитектуры. Современные сетевые требования охватывают все уровни: масштабирование внутри стойки, между стойками и между дата-центрами. Каждый из этих сценариев предъявляет единый набор требований к сетевому адаптеру: высокая пропускная способность, улучшенный протокол RDMA, минимальные задержки, качество обслуживания (QoS), а также поддержка виртуализации, безопасности, синхронизации времени, телеметрии и диагностики.
Архитектура и ключевые характеристики Thor Ultra Ethernet NIC
Адаптер Thor Ultra объединяет в себе хост-интерфейс PCIe Gen6 x16, восьмипортовый MAC-уровень на 100 Гбит/с, 256 виртуальных функций SR-IOV и восемь линий Serdes по 100 Гбит/с. Устройство обеспечивает разгрузку обработки трафика RoCEv2, бессостояниевую обработку пакетов и встроенное шифрование. Расширенный функционал RoCE поддерживает более 64 000 очередей (queue pairs), а также задействует движок TruFlow и средства безопасности BroadSAFE.
По сравнению с предыдущим поколением чипов Thor, новинка демонстрирует существенный технологический скачок. Среди ключевых особенностей выделяются распределение пакетов (packet spraying) с поддержкой получения данных не по порядку, надежность на уровне, превышающем протокол Go-Back-N, более простая и программируемая система управления перегрузками, а также удвоенное количество портов с поддержкой многоплоскостной (multiplane) связности.
Сам кремниевый кристалл выполнен по 5-нанометровому техпроцессу, содержит 2,4 миллиарда транзисторов в корпусе размером 27×27 мм, а его максимальное энергопотребление составляет 40–42 Вт. На кристалле четко различимы буферы приема и передачи (TX/RX), встроенная подсистема процессора и программируемые движки, близкие по архитектуре к языку P4, которые берут на себя большую часть задач расширенного RoCE (eRoCE).
Форм-факторы, коммутация и пакетный конвейер
Broadcom поставляет Thor Ultra в форм-факторах OCP NIC 3.0 и PCIe, которые сконфигурированы под один порт OSFP112 или два порта QSFP112. Порт OSFP112 поддерживает режимы 800G, 2х 400G, 4х 200G или 8х 100G, что позволяет операторам использовать единую плату для различных конфигураций плотности портов. Доступные варианты кабельной инфраструктуры включают медные кабели прямого подключения (DAC), линейные оптические модули (LPO), активные медные кабельные сборки (AEC) и стандартную оптику, при этом энергопотребление платы без учета оптики составляет 50–55 Вт.
Пакетный конвейер устройства устроен следующим образом: потоки передачи (TX) и приема (RX) обрабатывают рабочие очереди, транспортные протоколы, контроль перегрузок, программируемое планирование и управление плоскостями с помощью встроенного ПО и интерфейса PCIe, тогда как P4-подобные движки отвечают за программируемую обработку. Многопутевая маршрутизация распределяет пакеты по восьми плоскостям. Размещение вне очереди обрабатывает ответы RDMA, сохраняя строгий порядок отправки и атомарных операций, а надежная доставка опирается на выборочные подтверждения (SACK) и отрицательные квитанции (NACK) с механизмом ретрансляции. Выбор пути выполняется для каждого пакета, заголовки которого содержат информацию о размещении, а битовые карты SACK отслеживают полученные пакеты для каждой очереди.
Управление перегрузками и системная синхронизация
Система контроля перегрузок базируется на методе Receiver Credit-Based Congestion Control в качестве стандарта для eRoCE. Получатель передает кредиты активным отправителям, использует спекулятивные кредиты для старта на максимальной скорости линии и учитывает сигналы ECN, механизмы прореживания трафика (trimmings) и телеметрию CSIG, задействуя P4-подобные движки сопоставления и действий для настройки алгоритмов.
Для систем на базе графических и других ускорителей (XPU) реализован путь прямого доступа к памяти (peer memory). Thor Ultra использует механизм dma-buf для локального однорангового DMA между сетевым адаптером и памятью GPU, а также eRoCE для удаленных трансферов данных с пользовательской библиотекой RoCE в пространстве пользователя и соответствующим драйвером в ядре операционной системы. Поддержка многоарендности включает стандартные для современных сетевых карт функции QoS и виртуализации.
Синхронизация времени обеспечивается поддержкой стандарта PTPv2 с наносекундной точностью аппаратных меток времени пакетов и Precision Time Measurement. Входы и выходы секундных импульсов (PPS), плоскость точного времени суток (time-of-day) и внешний источник тактовой частоты TCXO питают аппаратный контроллер часов (PHC), что критически важно для слаженной работы крупных вычислительных кластеров ИИ и HPC.
Безопасность, программный стек и производительность
Вопросы безопасности закладываются непосредственно на уровне кремния: решение включает корень доверия на базе предохранителей (FUSE-based root of trust), загрузчик из ПЗУ (ROM bootstrap loader) и механизм аутентифицированных обновлений прошивки. Дополняют эту картину аттестация устройств по протоколу SPDM, а также шифрование и дешифрование на основе архитектуры PSP. В набор функций также входят мониторинг работоспособности, отслеживание температуры чипа и оптических модулей, диаграммы глазковых диаграмм, диагностика, дампы сбоев и ядер, а также возможности управления на базе стандартов DMTF и OCP.
Broadcom разделяет стеки ядра на драйвер RoCE bng_re и драйвер сетевого адаптера bng_en, поверх которых располагается пользовательская библиотека libbng_re. Все они взаимодействуют через стандартные интерфейсы libibverbs и rdma-core. Одноранговая память (peer memory) и прямые коллективные операции связываются с NCCL, RCCL и MPI через провайдер verbs и плагины xCCL, используя восходящую модель одноранговой памяти dma-buf, что позволяет оставлять приложения без изменений.
Компания приводит первичные данные по коллективным операциям на платформе с GPU пятого поколения. Конфигурация из двух узлов, каждый из которых оснащен восемью графическими процессорами Gen5 и шестнадцатью рангами через шестнадцать соединений со скоростью 400G, демонстрирует следующие показатели: операциях all_reduce показывает 383,93 ГБ/с, reduce_scatter — 380,23 ГБ/с при предельном значении в 400 ГБ/с. При этом alltoall ожидаемо выделяется с результатом 84,62 ГБ/с, что вполне логично для подобных рабочих нагрузок. Пропускная способность шины удерживается на уровне выше 96% от линейной скорости почти во всех операциях.
Что касается TCP-трафика, тест iperf3 на процессоре шестого поколения с 512 ГБ памяти DDR5-8000 демонстрирует однонаправленную скорость 791 Гб/с при 16 параллельных потоках, что составляет около 98,9% от канала 800G. Двунаправленный трафик суммарно достигает примерно 1,51 Тб/с, а пропускная способность растет практически линейно до восьми потоков, после чего канал насыщается. Для операций RDMA однонаправленный путь насыщается на отметке 781 Гб/с, а двунаправленный достигает 1558 Гб/с, что составляет около 97,6% от суммарной пропускной способности 1,6 Тб/с и примерно вдвое превышает однонаправленный показатель. Однонаправленный режим достигает примерно 88% от линейной скорости на сообщениях размером 32 КБ и выходит на уровень в пределах 3% от пикового значения при размере 128 КБ.
По заявлениям Broadcom, главными сложнейшими задачами, решенными в новом поколении, стали многопутевая маршрутизация, усовершенствования RoCE в части надежности и обработки сообщений вне порядка, а также программируемое управление перегрузками — все это завязано на конвейер обработки пакетов. Инженеры компании уделили серьезное внимание и инструментарию Linux. Платформа объединяет в себе всё необходимое: от физического кристалла до программного стека Linux и средств управления. Сетевой адаптер Thor Ultra изначально проектировался как системное решение для масштабирования искусственного интеллекта, где кремний, программное обеспечение и средства администрирования тесно взаимосвязаны.
Final Words
Выход Thor Ultra позволяет Broadcom уверенно занять место в сегменте высокоскоростных сетевых адаптеров 800G наряду с продуктами ConnectX-8 от NVIDIA и Vulcano от AMD. Архитектура передачи данных создана с расчетом на улучшенный протокол RoCE или MRC++, а поддержка качества обслуживания (QoS) и виртуализации открывает возможности для предоставления XPU и CPU как сервиса, дополняясь средствами безопасности, управления и синхронизации времени между системами. Учитывая, что первые физические образцы плат и чипов демонстрировались еще на саммите OCP в 2025 году, появление детальной технической информации об этих компонентах представляет большой интерес для индустрии.
Источник: servethehome.com

