Мой блог
Как на конференции GMIF обсуждали борьбу с Memory Wall в эпоху ИИ
В конце сентября я побывал в Шэньчжэне на масштабной конференции GMIF, полностью посвященной развитию искусственного интеллекта и современных систем хранения данных. Будучи разработчиком AI-систем для автоматизации IT-процессов, я не мог пропустить это событие, где эксперты подробно разбирали проблемы Memory Wall и пути их преодоления.
Организаторами мероприятия выступили Shenzhen Memory Industry Association и School of Integrated Circuits Peking University. Несмотря на свою локальную прописку, выставка порадовала высочайшим уровнем организации и реальными торговыми площадками вместо привычных демо-стендов, где прямо на месте можно было изучить актуальные прайсы и договориться о поставках оборудования.



Экономика и кризис памяти: взгляд Morgan Stanley
Основную открытую часть мероприятия открыл исполнительный директор Morgan Stanley Дэниел Йен (Daniel Yen). В своем докладе он подробно описал ключевую проблему индустрии — так называемую Memory Wall, то есть критический дисбаланс между бешено растущей производительностью GPU и пропускной способностью памяти. Ярким примером здесь выступает ускоритель Nvidia B200, который обрабатывает информацию примерно в 20 000 раз быстрее, чем ее способны поставлять чипы HBM3 или HBM4.
Помимо чисто технических трудностей, аналитики указали на серьезные экономические вызовы:
- Капитальные затраты мировых облачных гигантов стремятся к отметке в 1,2 триллиона долларов к 2027 году, причем доля расходов на память в них вырастет с 48% до 53%.
- Уже сейчас наблюдается структурный дефицит: спрос на обычную DRAM превышает предложение на 15%, а нехватка чипов NAND составляет около 10%.
- В структуре конечной стоимости аппаратуры память занимает все большую долю: до 73% в серверных CPU, 41% в ноутбуках и около 39% в смартфонах.
- Производственные ограничения усугубляются нехваткой мощностей под сложную 2.5D-упаковку CoWoS от компании TSMC.
Единственным выходом из сложившейся ситуации эксперты видят эволюцию техпроцессов, а также принципиально новый дизайн полупроводниковых чипов и методов их корпусирования.
Специфика китайского IT-сообщества и доклады лидеров
Конференция проходила в основном на китайском языке, сопровождаясь порой не самым точным английским переводом на экранах. Чтобы уверенно ориентироваться в контексте, мне пришлось воспользоваться простым инженерным лайфхаком — занимать места как можно ближе к динамикам, что позволяло комфортно сверять технические термины через автоматический переводчик.
Выступление компании Samsung
Среди англоязычных спикеров выделялся Кевин Юн (Kevin Yoon) из компании Samsung. Он акцентировал внимание на взрывном росте KV Cache. Из-за усложнения логики современных языковых моделей, многошаговых рассуждений и работы автономных агентов кеш ключей и значений перестал быть банальным буфером, превратившись в критический системный актив.

В качестве ответа на ограничения пропускной способности и энергопотребления Samsung предложила концепцию гетерогенной архитектуры. Ее суть заключается в распределении данных по уровням памяти в зависимости от частоты доступа к ним:
- Разработка проприетарной высокоскоростной технологии Z-NAND как промежуточного звена между DRAM и обычными SSD для размещения неизменяемых весов моделей.
- Внедрение интерфейсов CXL для масштабирования емкости и скоростной графической памяти GDDR7.
- Анонс запуска нового поколения CXL 3.1 и PCIe 6.0 CMM-D в 2026 году.
Инновации Пекинского университета и новые типы хранилищ
Не менее интересным оказалось выступление декана Школы интегральных схем Пекинского университета Цай Имао (Cai Yimao). Он презентовал концепцию High Bandwidth Flash (HBF) — гибридный класс памяти, объединяющий высокую скорость HBM с огромной емкостью 3D NAND за счет сохранения вертикальной упаковки через TSV-соединения. Подобное решение теоретически способно обеспечить объем до 512 Гб при пропускной способности от 0,4 до 3,0 ТБ/с.
Параллельно представители Solidigm и Sandisk демонстрировали возможности технологии Quad-Level Cell (QLC) для сверхплотной упаковки данных и создания максимально дешевых хранилищ под KV Cache. А совместный проект Infplane и Maxio показал концепт интеллектуального AI SSD, способного на уровне самого накопителя динамически распределять веса моделей и кеш между оперативной памятью и твердотельным диском.
Итоги конференции: стратегия Memory Offloading
Общим инженерным консенсусом всех участников стало внедрение подхода под названием Memory Offloading. Суть этой стратегии заключается в том, что тяжелые данные не должны постоянно удерживаться в дорогой и дефицитной высокоскоростной памяти вроде DRAM или HBM. Они должны грамотно вытесняться на более низкие уровни иерархии вплоть до емких SSD.

Конечно, это не просто привычное кэширование, а совершенно новый архитектурный подход к проектированию аппаратного обеспечения для инференса нейросетей. Подобные меры позволяют существенно снизить итоговую стоимость работы AI-приложений, хотя каждый производитель честно предупреждал о неизбежных компромиссах и ограничениях выбранных путей.
