Мой блог
Cerebras представила процессор WSE-3 Turbo и стоечную систему CS-4

Еще в 2019 году компания Cerebras Systems представила первую версию своего весьма необычного ускорителя искусственного интеллекта — Wafer Scale Engine. Оправдывая свое название, этот процессор размером с кремниевую пластину был призван обеспечить принципиально более высокую производительность за счет создания гораздо более крупного чипа. Вместо того чтобы разрезать пластину на отдельные кристаллы, разработчики задействовали практически всю кремниевую подложку целиком как единый ускоритель, что позволило создать крупнейший в мире процессор на базе 300-миллиметровой пластины. За прошедшие годы компания выпустила три поколения таких устройств, каждое из которых повышало производительность и привлекало все больше внимания разработчиков и коммерческих заказчиков. Самая недавняя версия, WSE-3, была выпущена в 2024 году и обеспечивает производительность в 125 петафлопс для разреженных данных FP16 на одном процессоре. Теперь компания выводит на рынок следующее поколение аппаратного обеспечения, центральным элементом которого стал обновленный процессор WSE-3 Turbo, удваивающий производительность своего предшественника.

На этом компания не останавливается: в текущем поколении она также представляет принципиально новую стоечную систему CS-4 и сетевую архитектуру, созданную специально для WSE-3 Turbo. Это позволяет объединить несколько гигантских процессоров в рамках одной стойки. На фоне продолжающегося бума на рынке искусственного интеллекта компания стремится не просто позиционировать свои разработки как более мощную альтернативу графическим процессорам, но и заложить фундамент на будущее — как в контексте современных масштабных систем, так и с точки зрения интеграции таких чипов в крупные дезагрегированные дата-центры. Иными словами, Cerebras переживает важный этап внедрения стоечной архитектуры, вступая в прямую конкурентную борьбу с новейшими решениями от NVIDIA и AMD.
WSE-3 Turbo: удвоение производительности за счет удвоения частот
Первым ключевым анонсом стал процессор WSE-3 Turbo. Будучи основой аппаратных усилий компании нового поколения, эта модель выглядит проще, чем может показаться. На бумаге устройство спроектировано для обеспечения вдвое большей производительности по сравнению с оригинальным WSE-3, а на практике оно демонстрирует работу на удвоенной скорости. Традиционно поколения чипов Cerebras привязывались к технологическим процессам TSMC, однако в данном случае ситуация выглядит иначе.
Если обратиться к сухим цифрам, перед нами снова предстает процессор размером с кремниевую пластину, объединяющий 900 000 специализированных ИИ-ядер Cerebras, которые работают в паре с 44 гигабайтами встроенной накристальной SRAM-памяти. Как и оригинальный WSE-3, модификация Turbo насчитывает 4 триллиона транзисторов и изготавливается по 5-нанометровому техпроцессу TSMC. Главным нововведением стало то, что инженеры компании существенно увеличили тактовые частоты практически для всех компонентов системы. Заявленная вычислительная пропускная способность выросла ровно в два раза и достигла 250 петафлопс для разреженных вычислений FP16, а пропускная способность встроенной памяти SRAM также удвоилась, составив 43,2 петабайта в секунду. Пропускная способность межсоединений (mesh fabric) и внешняя сетевая пропускная способность теперь составляют 53,5 петабайта в секунду и 300 гигабайт в секунду соответственно.
WSE-3 Turbo: удвоение тактовой частоты и энергопотребление
Поскольку практически каждый важнейший элемент процессора WSE-3 функционирует на удвоенной скорости, компания Cerebras получила прямой путь к двукратному росту производительности в новой модификации WSE-3 Turbo. Помимо самих вычислительных возможностей, разработчики пока не раскрывают официальные данные об энергопотреблении ускорителя. Увеличение тактовых частот процессора вдвое неизбежно ведет к росту энергопотребления за счет смещения вверх по кривой зависимости напряжения и частоты, что потенциально может вывести чип за пределы оптимального диапазона эффективности.
В компании заявляют, что серверная стойка CS-4, изначально спроектированная под процессор WSE-3 Turbo, «обеспечивает подачу вдвое большего количества энергии», что прямо намекает на двукратное увеличение энергопотребления новинки — примерно до 54 кВт. Если эти показатели подтвердятся, это станет впечатляющим достижением инженеров Cerebras. Оно будет означать, что разработчикам удалось обуздать кривую напряжение/частота настолько эффективно, чтобы поднять тактовую частоту в два раза без возникновения сверхлинейного скачка энергопотребления.
Система Cerebras CS-4: масштабирование трех кристаллов в одной стойке
Вторым важным аппаратным анонсом компании стала стоечная вычислительная система CS-4, представляющая собой первое полноценное решение масштаба стойки. Пришедшая на смену системам CS-3 с процессорами WSE-3, новая платформа CS-4 предлагает радикально переработанную архитектуру всего аппаратного окружения единого гигантского кремниевого кристалла. Этим шагом компания закладывает прочный фундамент для масштабирования, выходящего далеко за рамки одного wafer-scale процессора.
Для понимания исходного контекста: платформа прошлых поколений базировалась на одном чипе WSE и представляла собой минимальный неделимый блок экосистемы. Каждая такая установка занимала 16 юнитов в стоечном исполнении, имела жидкостное охлаждение и монтировалась в серверную стойку. И хотя вендор предлагал готовую конфигурацию CS-3 Rack, она фактически состояла из двух независимых систем в едином корпусе. Более того, при развертывании крупных кластеров эти комплексы не работали по принципу современных систем масштабирования scale-up.
Именно поэтому для CS-4 инженеры полностью перепроектировали серверную архитектуру и конструкцию стойки, добившись более высокого уровня производительности и масштабируемости. Создателям потребовалась инфраструктура, способная не только справиться с возросшими требованиями более быстрого и прожорливого процессора WSE-3 Turbo, но и обеспечить улучшенные сетевые возможности и эффективное взаимодействие между узлами. Новинка разработана с расчетом на выполнение всех этих задач и предлагает следующие ключевые характеристики в сравнении с прошлым поколением:
- Кристаллы (Wafers): 3x WSE-3 Turbo в CS-4 против 1x WSE-3 в CS-3.
- Производительность (Sparse FP16): 750 петафлопс против 125 петафлопс.
- Объем SRAM: 132 ГБ против 44 ГБ.
- Пропускная способность памяти: 129,6 ПБ/с против 21,6 ПБ/с.
- Пропускная способность фабрики связей: 160,5 ПБ/с против 26.7 ПБ/с.
- Пропускная способность ввода-вывода (I/O Bandwidth): 900 ГБ/с против 150 ГБ/с.
- Задержка ввода-вывода (I/O Latency): 2 микросекунды против 5 микросекунд.
Полноразмерная стоечная система в центре архитектуры CS-4 теперь объединяет сразу три процессора WSE-3 Turbo. Если сравнивать с одиночным WSE-3 старого образца, это втрое больше вычислительных ядер на пластине. Даже при сопоставлении с крупной двухчиповой стойкой CS-3 Rack прирост составляет 50% в расчете на одну стойку. С учетом двукратного ускорения каждого отдельного чипа Turbo суммарная отдача стойки CS-4 достигает шестикратного превосходства над базовым CS-3 или примерно троекратного роста относительно старой двухчиповой стойки.
Однако главная инженерная сложность заключалась вовсе не в вычислителях, а во всей сопутствующей инфраструктуре. Чтобы разместить в одном корпусе большее число более мощных и горячих микросхем, специалисты разработали совершенно новую платформу. Она способна справляться с нагрузками WSE-3 Turbo и при этом обладает модульной гибкостью для внедрения будущих поколений кремниевых процессоров и сопутствующих технологий. Эту передовую разработку в компании называют платформой Nexus.
Платформа Nexus имеет модульную архитектуру. Блоки питания, вентиляторы и сопутствующее аппаратное обеспечение инженеры разместили в передней части стойки, а процессоры WSE установлены сзади. Такая многопоколенческая конструкция рассчитана на перспективу: она позволяет повторно использовать стойки Nexus, заменяя WSE и другие компоненты по мере необходимости для обслуживания или модернизации оборудования. В компании делают акцент на универсальности компоновки, обеспечивающей гибкость внедрения новейших технологий в будущем.
Каждый процессор WSE в стойке Nexus помещен в специальный модуль, который в компании называют «рюкзаком» (backpack). Это автономная вертикальная система WSE, предназначенная для установки в стойку Nexus. Такой «рюкзак» CS-4 выступает в роли нового эволюционного этапа по сравнению с двигательными блоками предыдущих поколений от CS-1 до CS-3. На этот модуль возложена задача не только подключения WSE к силовым цепям и контурам жидкостного охлаждения стойки, но и интеграции процессора с сетевыми интерфейсами и остальным вводом-выводом, распределенным по стойке.
Сетевые возможности и архитектура CS-4
Сетевая подсистема в системе CS-4 вышла на совершенно новый уровень относительно предшественника CS-3. С точки зрения чистой пропускной способности внешняя сетевая инфраструктура WSE-3 Turbo также демонстрирует двукратный рост — показатель увеличился со 150 до 300 ГБ/с. Это гарантирует возросшую пропускную способность и снижение задержек при обмене данными между кремниевыми пластинами. Вместе с запуском платформы Nexus компания внедряет более масштабное и сложное сетевое железо.
Каждый WSE в защитном модуле дополнен модулями ввода-вывода пластины, содержащими всю сетевую обвязку. Применение модульного ввода-вывода позволяет частично отделить сетевые компоненты от самих процессоров WSE, обновляя и модернизируя их независимо друг от друга. По задумке разработчиков, такой подход упрощает интеграцию перспективных сетевых стандартов в дальнейшем и подтверждает заложенную в платформу Nexus модульность. Для начальной версии стойки CS-4 в качестве масштабируемой сети используется технология RDMA over Converged Ethernet версии 2 (RoCEv2).
Учитывая заложенный запас гибкости, в перспективе можно ожидать появления поддержки таких стандартов, как UALink или Ultra Ethernet, по мере их выхода на рынок. Помимо стандартных решений, разработчики предлагают нетипичную второстепенную или опциональную топологию для стоек CS-4. В этом режиме вместо традиционных коммутаторов Ethernet с топологией «звезда» модули объединяются в цепочку.
Перспективы платформы Nexus
По заявлениям представителей компании, подобное решение направлено на минимизацию задержек при обмене данными между пластинами, снижая показатель в общей сложности до 2 микросекунд. Кроме того, это упрощает общую архитектуру стоек Nexus и повышает общую модульность, исключая необходимость в громоздких сетевых компонентах внутри стойки, за исключением элементов внутри самих «рюкзаков». В итоге формируется сеть прямых соединений между модулями, что избавляет инженеров от потребности в коммутаторах и сложной маршрутизации кабелей.
В долгосрочной перспективе платформа Nexus послужит фундаментом для следующих поколений стоечных систем Cerebras. Помимо модели CS-4, руководство компании уже официально подтвердило ее использование в перспективных системах CS-5 и CS-6, релиз которых запланирован на текущее десятилетие.
Источник: servethehome.com

