Загрузка 0
ПОДЕЛИТЬСЯ

Мой блог

Листай вниз

Тензорные ядра больше не спасают: почему ИИ-ускорители упрутся в память и как Samsung готовится к эпохе HBM5

Тензорные ядра больше не спасают: почему ИИ-ускорители упрутся в память и как Samsung готовится к эпохе HBM5

Когда ускорителю нечего считать

Гонка вооружений в сфере искусственного интеллекта привела к тому, что чипмейкеры неустанно наращивают количество тензорных ядер и внедряют всё более агрессивное квантование — вплоть до форматов FP8 и FP4. На презентациях мы видим впечатляющие цифры терафлопсов, однако на практике реальное железо сталкивается с серьезным барьером. Вычислительным блокам критически не хватает «топлива»: если система не успевает прокачивать веса нейросетей и промежуточные вычисления с нужной скоростью, миллиарды транзисторов дорогостоящего ускорителя банально простаивают в ожидании данных.

Компания Samsung намерена принципиально изменить ситуацию с выходом памяти HBM5. Инженеры рассчитывают двукратно увеличить пропускную способность по сравнению с HBM4E и улучшить энергоэффективность на ватт примерно на 20%. В перспективе пропускная способность единственного стека HBM5 способна приблизиться к 4 ТБ/с благодаря внедрению 4096-битной шины. Я внимательно изучил технические детали этого анонса и предлагаю подробно разобрать, почему архитектура современных AI-чипов уперлась именно в память.

Подложка и контактные площадки для подключения памяти HBM5
Интерфейсные соединения высокой плотности для организации широкой шины HBM5.

Любая крупная языковая модель представляет собой гигантский массив числовых параметров. В процессе работы ускоритель должен беспрерывно извлекать эти коэффициенты из памяти, загружать их в математические блоки, выполнять матричные операции и отправлять промежуточные результаты обратно. Данный цикл повторяется для каждого слоя сети и для каждого генерируемого токена.

Реклама

Если производитель удвоит число тензорных ядер на чипе, паспорные показатели производительности подскочат в два раза. Однако реальный прирост скорости будет достигнут только в том случае, если все эти ядра удастся непрерывно снабжать информацией. Когда пропускная способность памяти оказывается ниже потребностей вычислительного кристалла, часть блоков простаивает. В итоге микросхема выходит более крупной, горячей и дорогой, а фактическая скорость работы нейросетевых моделей практически не меняется.

Ключевую роль здесь играет показатель вычислительной интенсивности — отношение количества выполненных операций к объему пропущенных байтов. Если блок данных загружается один раз, а затем активно участвует в длинной серии матричных вычислений, итоговая скорость зависит от мощности тензорных ядер. Но когда алгоритму требуется постоянно перечитывать исходные параметры из памяти, именно подсистема памяти становится главным узким местом, и дальнейшая установка вычислительных блоков теряет смысл.

Эта проблема проявляется наиболее остро при пошаговой генерации текста. Чтобы сформировать один единственный новый токен, ускоритель вынужден полностью прогнать данные через все слои модели, повторно прочитав их веса из памяти. При одновременной обработке небольшого количества запросов повторное использование весов оказывается крайне низким, и скорость работы упирается исключительно в пропускную способность шины памяти.

Параллельно с ростом контекста стремительно увеличивается и объем KV-кэша, в котором сохраняются ключи и значения для уже обработанных токенов. Чем длиннее обрабатываемый документ или диалог и чем больше сессий закручено одновременно, тем масштабнее становится массив данных для считывания. Следовательно, одного лишь наращивания объема недостаточно: емкость определяет, поместится ли модель в ускоритель, а пропускная способность — насколько быстро она будет работать.

Реклама

Инженеры пытаются нивелировать эту проблему с помощью сложной системы кэширования, упреждающей выборки данных и перехода на пониженную точность FP8/FP4. Однако встроенная сверхоперативная память SRAM отнимает слишком много ценной площади на кремниевом кристалле, из-за чего разместить в ней десятки гигабайт параметров невозможно. А переход на 8-битные и 4-битные форматы хоть и снижает объем передаваемой информации, но лишь временно даёт дыхание системе: разработчики тут же увеличивают размеры самих моделей и длину контекста, мгновенно забивая освободившийся канал.

Как HBM добралась до 2048-битной шины

Классическая оперативная память стандарта DDR подключается к процессору через относительно узкие каналы и монтируется на отдельных текстолитовых планках. Это недорогое и гибкое решение для обычных ПК, где модули легко заменить или добавить. Однако для тысяч параллельно работающих потоков в AI-ускорителе возможностей классической шины DDR катастрофически не хватает.

Технология HBM коренным образом меняет компоновку: кристаллы DRAM накладываются друг на друга по вертикали и соединяются сквозными кремниевыми каналами TSV (Through-Silicon Via). Собранный стек размещается в непосредственной близости от вычислительного ядра на единой кремниевой подложке (интерпозере). Короткие физические линии связи позволяют реализовать экстремально широкую шину и передавать огромные массивы данных с минимальными задержками и энергозатратами.

Уже первое поколение HBM обладало 1024-битным интерфейсом на каждый стек, тогда как один канал стандартной памяти DDR имеет ширину всего 64 бита. В последующих ревизиях инженеры наращивали число слоев в стеке, объемы кристаллов и частоту работы линий. Память HBM3 и HBM3E стала стандартом де-факто для современных ускорителей обучения и инференса, перешагнув порог пропускной способности в 1 ТБ/с на один стек.

Вертикальная структура стека памяти HBM с кремниевыми проводниками TSV
Строение вертикального стека HBM с микроскопическими каналами TSV.

Бесконечно поднимать тактовую частоту передачи данных невозможно. На высоких скоростях возрастают затухания сигнала, усиливаются перекрестные помехи между соседними линиями и сужаются временные допуски. Для борьбы с этим приходится усложнять схемы приемопередатчиков и блоки коррекции сигналов, а они занимают лишнюю площадь и увеличивают энергопотребление.

По этой причине в стандарте HBM4 разработчики пошли по пути расширения интерфейса, увеличив ширину шины с 1024 до 2048 бит. Это можно сравнить с расширением автомагистрали: чтобы пропустить вдвое больше транспорта, не обязательно заставлять машины мчаться с безумной скоростью — достаточно удвоить количество полос. Правда, для реализации 2048-битного интерфейса потребовалось кардинально переработать контроллеры, увеличить число контактных площадок и усложнить межблочную подложку.

Зачем HBM5 4096 бит

Ожидается, что предельная скорость передачи данных для контактов памяти HBM4E составит порядка 12–16 ГТ/с. При этом Samsung ставит амбициозную цель — удвоить производительность HBM5 относительно HBM4E. Если сохранить 2048-битную шину, то для достижения такой цели частоту работы каждого контакта пришлось бы поднять до сумасшедших 24 ГТ/с.

Реклама

Обеспечить стабильную передачу данных на такой частоте по нескольким тысячам параллельных линий невероятно сложно. Наводки и искажения сигнала потребуют установки громоздких приемопередатчиков и жестких алгоритмов эквализации. В результате вся потенциальная выгода в энергоэффективности будет съедена служебными обвязками интерфейса.

Логичным выходом из тупика выглядит очередное удвоение ширины шины — до 4096 бит. Подобный интерфейс позволит прокачивать вдвое больше данных при сохранении разумных частот на каждый контакт. Возможен и компромиссный вариант: использование 3072 линий в сочетании с умеренным разогоном частотной характеристики.

Стоит заметить, что Samsung пока официально не подтвердила использование именно 4096-битной шины в спецификациях HBM5. Разработчик обозначил целевые цифры по пропускной способности, но конкретные инженерные методы их достижения пока находятся в стадии утверждения. Поэтому параметры шины и пиковую скорость порядка 4 ТБ/с на стек пока разумнее считать целевым ориентиром отрасли.

Физическое расширение шины несёт в себе серьезные технологические вызовы. Для каждой новой линии требуются физические микробугорки, передатчики и приемники на базовом кристалле logic die. Когда вокруг одного AI-ускорителя размещается массив из 6–8 стеков HBM5, общее число соединений на подложке будет измеряться десятками тысяч. Все их необходимо развести на мизерной площади рядом с мощным вычислительным чипом и силовыми цепями.

Процесс упаковки такой системы становится предельно рискованным. Даже если все кристаллы DRAM и вычислительный процессор прошли тесты на брак, единственная неисправная микроскопическая связь при сборке на подложке приведет к отбраковке всего готового модуля. Потребуются новые сверхплотные интерпозеры, глубокий контроль на промежуточных этапах производства и встроенные схемы резервирования физических линий.

Что 4 ТБ/с дадут ИИ-системам

Появление пропускной способности в 4 ТБ/с на каждый стек позволит ускорителям параллельно обслуживать существенно больше клиентских сессий и работать с гигантскими контекстными окнами без быстрого упирания в барьер памяти. Для операторов коммерческих дата-центров это критически важный фактор: чем выше плотность утилизации каждого сервера, тем ниже общие затраты на инфраструктуру и эксплуатацию.

В задачах обучения нейросетей эффект будет варьироваться в зависимости от характера вычислительных блоков. Классическое умножение плотных матриц отлично загружает тензорные ядра и задействует локальные данные повторно. А вот операции нормализации, механизмы внимания (Attention) и алгоритмы маршрутизации в архитектурах с несколькими экспертами (Mixture of Experts, MoE) крайне чувствительны к скорости памяти. В этих сценариях HBM5 позволит убрать постоянные микропростои блоков.

При этом двукратный рост пропускной способности подсистемы памяти не гарантирует автоматического удвоения скорости работы абсолютно всех AI-моделей. Если конкретная задача изначально ограничена производительностью самих тензорных ядер, новая память не даст ощутимого эффекта. Реальные показатели будут ниже теоретических пиков и при хаотичном доступе к адресам памяти или неоптимальной раскладке данных.

Samsung заявляет о намерении повысить показатель производительности на ватт на 20% по сравнению с HBM4E. Однако это не означает снижение абсолютного энергопотребления: при удвоении общего потока данных суммарная электрическая мощность стека всё равно вырастет. Повысить эффективный расход энергии поможет перевод базового управляющего кристалла (base die) на передовой технологический процесс 2 нм (в HBM4 задействован техпроцесс 4 нм).

Параллельно обострится проблема теплоотвода. Отводить тепловую энергию от многослойного кремниевого «пирога» гораздо сложнее, чем от плоского монолитного чипа. Для HBM5 инженеры Samsung проектируют специализированную внутреннюю структуру Heat Path Block с интегрированными теплопроводящими вставками прямо внутри стека. Это должно снизить тепловое сопротивление на 20%, упростив передачу тепла на внешнюю систему охлаждения. Впрочем, для флагманских AI-серверов переход на контуры жидкостного охлаждения становится фактически неизбежным.

Как поменялась индустрия ИИ-ускорителей

История разработки HBM5 наглядно демонстрирует, что эпоха простого наращивания вычислительных терафлопсов подошла к концу. Современный AI-ускоритель превратился в сложнейший системный комплекс, где производительность одинаково сильно зависит от памяти, топологии шины, технологий упаковки, подсистемы питания и эффективности охлаждения. Любой дисбаланс моментально превращает дорогостоящий чип в неэффективное железо.

Безусловно, даже внушительная планка в 4 ТБ/с на стек не решит проблему с памятью раз и навсегда. Как только в распоряжении разработчиков окажется столь мощный канал связи, индустрия ответит созданием ещё более масштабных моделей с контекстом в миллионы токенов. Через некоторое время передача данных снова станет узким местом, но HBM5 даст необходимый запас прочности для развития нейросетей на ближайшие годы.

Источник: habr.com

Реклама
01.