Загрузка 0
ПОДЕЛИТЬСЯ

Мой блог

Листай вниз

NVIDIA представила DPU BlueField-4 для платформ искусственного интеллекта

NVIDIA представила DPU BlueField-4 для платформ искусственного интеллекта

Архитектурные особенности NVIDIA BlueField-4 DPU на конференции Hot Chips 2026

Компания NVIDIA представляет на конференции Hot Chips 2026 процессор NVIDIA BlueField-4 DPU — четвертое поколение своего дата-центрового процессора обработки данных. Представленная архитектура ближе к связке Grace с ConnectX-9, а не к более крупной версии Vera, что представляет отдельный интерес. Выступление проходит в прямом эфире, поэтому возможны оперативные уточнения.

Новый процессор рассматривается в рамках концепции компании, согласно которой агентный искусственный интеллект представляет собой наиболее сложную вычислительную нагрузку на сегодняшний день. NVIDIA позиционирует этот DPU как ключевой компонент, объединяющий центральный процессор, графический ускоритель и сеть, что позволяет ИИ-агентам последовательно выполнять операции наблюдения, рассуждения и принятия решений. Подобная архитектурная визуализация демонстрируется на конференции уже не впервые.

Платформа Vera Rubin, в которую интегрирован чип, описывается как полностековая фабрика искусственного интеллекта, распределенная по семи чипам и пяти стойкам. Процессор обработки данных выступает одним из этих семи чипов, функционируя в тесной связке с центральным процессором Vera и коммутатором Spectrum-6. В этой архитектуре DPU отвечает за сетевую инфраструктуру, безопасность и работу с хранилищами данных в каждом узле дата-центра. Универсальные вычисления и бизнес-логика выполняются на CPU, в то время как параллельные задачи искусственного интеллекта и высокопроизводительных вычислений закреплены за GPU.

NVIDIA наделяет DPU ролью доверенного элемента платформы — сервера перед сервером, который изолирует хост-систему от общей фабрики дата-центра и контролирует путь передачи данных клиента. Масштабирование внутри узла (scale-up) реализуется с помощью технологии NVLink, позволяя нескольким графическим процессорам работать как единая система в рамках одного арендатора, обеспечивая непрерывную подачу данных на GPU до подключения внешней фабрики. Горизонтальное масштабирование (scale-out) задействует сетевую фабрику, охватывающую коммутаторы ConnectX и Spectrum-X, что объединяет весь дата-центр в единую вычислительную единицу. При этом масштабирование внутрь (scale-in) рассматривается отдельно.

Каждая система Vera Rubin изначально проектируется с интегрированным чипом BlueField, объединяющим сервисы безопасности, работы с данными и инфраструктуры на уровне всей платформы. Это знаменует собой переход от практики опциональной установки платы DPU в готовый сервер к системному проектированию, что соответствует фокусу компании на масштабах целых дата-центров. Крупнейшие облачные провайдеры эксплуатируют оборудование крупными партиями и повсеместно используют такие процессоры, поэтому их включение в стандартный дизайн ИИ-фабрики NVIDIA выглядит закономерным.

В рамках мероприятия анонсирована сетевая архитектура scale-in на базе BlueField-4 Spectrum-X — комплексное сетевое решение для смешанных агентных нагрузок. Scale-in управляет трафиком между хостом и внешней инфраструктурой дата-центра, распределяя его между различными приложениями и арендаторами. Первые показатели производительности связаны с доступом к хранилищам: Spectrum-X Ethernet обеспечивает ускорение доступа в 1,5 раза для файлов объемом 5 ГБ по сравнению со стандартными Ethernet-решениями, демонстрируя 1,4-кратный прирост для файлов на 10 ГБ и 1,3-кратный для 50 ГБ.

Для эффективной работы требуются как мощное сетевое ускорение, так и серьезные вычислительные мощности. NVIDIA объединяет сетевой функционал класса ConnectX-9 с ядрами уровня центрального процессора Grace для обработки задач плоскости управления, шифрования и операций ввода-вывода с хранилищами на высокой скорости, что перекликается с ранее представленными данными о процессоре Vera CPU. Прошлые поколения облачных процессоров данных создавались для универсальных облачных вычислений, напоминая универсальный подход образца Hot Chips 2021 года, когда DPU рассматривался как заменяемая карта расширения. Компания последовательно развивала свою дорожную карту, объединяя ядра Arm, графические ускорители и сетевые интерфейсы в единый модуль. Однако агентный искусственный интеллект требует принципиально иной инфраструктуры: если старые облачные DPU обеспечивали совокупную пропускную способность на уровне 200 Гбит/с, то специализированные решения для ИИ достигают 7 Тбит/с, при этом новые чипы глубоко интегрированы в систему на этапе проектирования, в отличие от прежних плат расширения с интерфейсом PCIe.

Технические характеристики и аппаратная база

Аппаратная платформа объединяет процессор Grace с 64 ядрами Arm Neoverse V2, функционирующими на тактовой частоте 1,7 ГГц, пропускную способность памяти LPDDR5 на уровне 275 ГБ/с, а также сетевой контроллер ConnectX-9 с поддержкой 800G Ethernet на базе 200G PAM4 SerDes. Устройство оснащено встроенными средствами шифрования и хост-интерфейсом PCIe Gen6 x16. Указанная частота в 1,7 ГГц выглядит ниже по сравнению с показателями систем на базе AI-станций GB300 или стандартных серверов Grace, что, вероятнее всего, обусловлено необходимостью удержания энергопотребления в строго заданных пределах. Кроме того, здесь задействованы только 64 ядра Arm. Данному слайду явно не хватало детальных данных по тесту SPECINT 220 — будь то оценки для SPEC CPU2017 или CPU2026 в режимах int rate и peak. Подобные упущения носят академический характер, поскольку масштабное увеличение производительности достигается за счет более крупных и быстрых ядер. Если сопоставлять новинку с решениями конкурентов, эксперты ожидают существенно более высокие скорости по сравнению с Xsight Labs E1 DPU, так как архитектура использует ядра V2 вместо N2.

Архитектура Vera Rubin создает серьезную проблему пропускной способности. Каждая вычислительная стойка требует совокупной сетевой пропускной способности на уровне 7 Тбит/с, которая формируется из четырех каналов масштабирования GPU по 1,6 Тбит/с и 800 Гбит/с внутреннего трафика масштабирования (scale-in) до DPU. По утверждению NVIDIA, без выделенного DPU, контролирующего путь данных, невозможно обеспечить сквозную защиту GPU-сети и ее изоляцию от арендаторов. При традиционном подходе изолируется только трафик scale-in, тогда как трафик scale-out остается уязвимым. Альтернативные подходы без использования DPU также многократно увеличивают энергопотребление, поскольку каждый сетевой адаптер требует отдельного центрального процессора, собственной подсистемы памяти и управляющего соединения. По оценкам компании, это приводит к четырехкратному росту энергопотребления по сравнению с установкой BlueField-4 перед хостом.

Платформа меняет этот подход благодаря технологии Astra, которая обеспечивает безопасность и управляемость корпоративного класса на скорости 7 Тбит/с, возлагая на DPU полный контроль над путем передачи данных. Обеспечивается соблюдение принципов нулевого доверия (Zero Trust) и сбор телеметрических данных на максимальной скорости интерфейса без прямой нагрузки на хост. В Astra используются каналы связи для управления и сопутствующих задач (в системе Vera Rubin судя по демонстрации применяются интерфейсы PCIe), из-за чего компании не требуется размещать отдельный модуль на каждом из портов ConnectX-9. На бумаге такая схема масштабирования подтверждается реальными замерами пропускной способности, которая демонстрирует идеальный линейный рост по мере увеличения числа сетевых адаптеров. Зашифрованный и виртуализированный трафик масштабирования сохраняет защищенность и управляемость по мере расширения платформы до многотерабитных значений. Хотя корпорация Broadcom ранее представила более детализированный срез производительности, новинка относится к совершенно другому классу устройств по сравнению с Thor Ultra.

Краткая живая демонстрация наглядно показывает работу платформы совокупной производительностью 7 Тбит/с в составе инфраструктуры Vera Rubin. Все желающие могут ознакомиться с ней в виртуальном формате в рамках мероприятия Hot Chips 2026. Разработчики демонстрируют, как DPU отслеживает все сетевые адаптеры ConnectX-9 и проходящие через них потоки данных. Отдельное внимание уделено организации доступа к хранилищам данных для графических процессоров Rubin. Интерфейс NVMe over fabrics, функционирующий на базе связки BlueField-4 и Grace, обеспечивает пропускную способность 1,6 Тбит/с при задействовании 8 ядер и достигает 20 миллионов IOPS при использовании 16 ядер, гарантируя двукратное ускорение доступа графических процессоров к информации.

На стороне процессора Vera платформа реализует прозрачную агентную безопасность за счет аппаратной принудительной реализации политик. Технологии DOCA Flow, DOCA Vault и DOCA Argus сопоставляют контекст файлов, объектов, процессоров и сети, поддерживая соблюдение регламентов безопасности на скорости работы самих агентов. Обработка трафика с мелкими пакетами традиционно становится слабым местом для плоскостей управления, однако представленное решение ориентировано на обеспечение сетевых операций со скоростью линии для искусственного интеллекта. Процессор поддерживает бесперебойную маршрутизацию и проверки безопасности, предотвращая сбои при поступлении миниатюрных фреймов.

Концепция Storage-Scale расширяет контекст агентов на уровне многоуровневой карты памяти. Инструмент DOCA MEMOS обеспечивает пропускную способность подсистемы хранения данных на уровне 3,2 Тбит/с, десятикратный прирост операций ввода-вывода в секунду и пятикратное повышение эффективности, перемещая ключевой контекст «ключ-значение» из высокоскоростной памяти GPU HBM через системную память в локальное и сетевое хранилище. Стоит отметить, что термин «Two BlueField-4 Vera devices» охватывает широкий спектр конфигураций: NVIDIA использует наименование «BlueField-4» как для версий на базе Grace с одним контроллером ConnectX-9, так и для сложных систем с одним или двумя процессорами Vera в сочетании с несколькими адаптерами ConnectX-9.

Ранее уже звучали рекомендации ввести более наглядное разделение версий, например, BlueField-4G на базе Grace и BlueField-4V на базе Vera, чтобы проще ориентироваться в модификациях. Сама компания позиционирует разработку как первый ИИ-нативный DPU, охватывающий архитектуры scale-up, scale-out, scale-in и storage-scale. Это был содержательный и качественный доклад.

Итоги и перспективы

Главная идея компании заключается в том, что DPU перестает быть рядовой платой расширения и превращается в надежный интерфейсный модуль всей инфраструктуры искусственного интеллекта. Для разработчиков стоечных систем это действительно серьезная трансформация. Благодаря значительно более мощному центральному процессору по сравнению с предшественниками, новая архитектура получила необходимый запас производительности для полноценной обработки задач безопасности и работы с хранилищами, с которыми предыдущие поколения справлялись с трудом. В итоге новый процессор производит впечатление масштабного и качественного скачка для всего поколения подобных решений.

Источник: servethehome.com

Оставить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

01.
На платформе MonsterInsights