Мой блог
Устройство вычислительной памяти XCENA MX1 CXL представлено на Hot Chips 2026

Архитектура и возможности памяти XCENA MX1 CXL
Инновационное вычислительное устройство XCENA MX1 CXL впервые было продемонстрировано на конференции Hot Chips 2026 в рамках совместной сессии с Samsung, где новинка показана в связке со стоечным планом памяти CXL. Модель MX1 представляет собой компонент CXL типа 3, объединяющий сразу три концепции в едином корпусе: расширение памяти CXL, твердотельный накопитель, представленный в виде адресной на уровне байтов памяти CXL, а также обработку данных вблизи памяти с помощью тысяч ядер RISC-V. Первое поколение MX1 дебютировало как вычислительный модуль памяти CXL 3.0, а текущая презентация развивает эту концепцию до масштабов целой стойки серверов.
Главный тезис разработчиков заключается в том, что современные искусственные интеллекты и ресурсоемкие рабочие нагрузки упираются в ограничения емкости памяти, пропускной способности и энергоэффективности задолго до того, как исчерпывается потенциал чистых вычислительных мощностей. Расширение памяти CXL опирается на четыре канала DDR5-8400, обеспечивая объем до 2 ТБ. Кроме того, на корневом порту MX1 интегрирован накопитель, который полностью транслируется в память CXL и доступен хосту в полном объеме. Наконец, архитектура включает вычислительные блоки вблизи памяти, состоящие из 3 072 специализированных ядер RISC-V.
Чип изготавливается по техпроцессу 4 нм на производственных мощностях Samsung Foundry. Его кристалл разделен на 24 подсистемы, каждая из которых состоит из четырех кластеров по 32 вычислительных модуля, что в сумме дает 3 072 модуля (MU). Подсистема выступает в роли базовой единицы распределения задач хоста: она способна выполнять независимый процесс и использовать общий кэш третьего уровня объемом 128 МБ. Инженеры выбрали множество простых последовательных ядер RISC-V вместо меньшего числа крупных вычислителей, поскольку целевые задачи чувствительны к пропускной способности и энергопотреблению. Компактные ядра позволили разместить на кристалле 3 072 единицы при минимальном энергопотреблении на байт.
Открытая система команд (ISA) предоставляет зрелую экосистему инструментов и возможности для добавления пользовательских инструкций, ориентированных на параллельную обработку данных. К таким задачам относятся внутрипамятевая аналитика, поиск с дополненной генерацией (RAG) и сжатие данных. Вдобавок к скалярным модулям предусмотрен векторный процессорный движок (Vector Processing Engine), добавляющий векторный путь обработки. Устройство обеспечивает пиковую производительность операций скалярного произведения на уровне около 3 TFLOPS на один SoC MX1. Сюда входят поэлементная арифметика, редукции, CRC32, векторно-скалярные вычисления, а также очереди команд для каждого модуля, оптимизированные под векторный поиск RAG и оценку кэша ключей-значений (KV cache).
Организация памяти и программное обеспечение
Локализация данных внутри кристалла имеет критическое значение. Каждый кластер разделяет кэш инструкций L1 объемом 8 КБ между четырьмя модулями и кэш данных L2 объемом 256 КБ между 32 модулями, а общий кэш LLC на 128 МБ объединяет все кластеры в единую систему. Инструкции оперируют физическими адресами, в то время как данные используют виртуальные адреса хоста, а трансляция осуществляется совместно на уровне кластера.
Важнейшим архитектурным решением стало использование единого виртуального адресного пространства, общего для хоста и вычислительных модулей. Хост и устройство видят одинаковые указатели, что позволяет безопасно работать со структурами данных, насыщенными указателями. Это дает возможность переносить существующий код на базе стандартного malloc в память CXL с минимальными изменениями, тогда как специальный менеджер памяти с поддержкой CXL удерживает табличные страницы для каждого арендатора, изолируя ядра одного приложения от памяти другого.
На уровне программного обеспечения разработчики поставляют среду выполнения в стиле MapReduce под названием PXL (Parallel Xceleration Library). Библиотека PXL сопровождает приложение от контекста устройства до определения ядра на C, C++ или Rust, выделяет подсистемы для задач и предоставляет API отображения, распределяющее работу между ядрами модулей с автоматическим управлением распределением и синхронизацией.
Показатели производительности демонстрируют превосходство нового решения: пропускная способность достигает 4,7x по сравнению со схемой хост-через-CXL и 2x по сравнению с локальной памятью DRAM при энергопотреблении на уровне примерно четверти от аппетитов хоста. В результате общая эффективность возрастает до 18,7x по сравнению с интерфейсом CXL и до 6,2x по сравнению с DRAM. Данные тесты проводились на референсной системе Intel Xeon 6767P без учета энергопотребления в режиме простоя.
Помимо традиционной динамической памяти, MX1 выставляет емкость SSD в качестве байт-адресуемой памяти CXL с помощью технологии, получившей название Infinite Memory. Она использует гибридную архитектуру DRAM-plus-NAND, в которой память DRAM выступает в роли кэша для страниц накопителя. Сам SSD разбит на страницы по 64 КБ, отслеживаемые кэшем таблиц страниц (TLB) на 1024 записи. Промахи кэша обрабатываются микропрограммой, выполняющейся непосредственно на ядрах вычислительных модулей.
По сути, перед нами решение для многоуровневого кэширования памяти, концепцию которого рынок уже неоднократно видел в разных вариациях, но теперь с фирменным подходом XCENA. Если рассуждать об этом в контексте индустрии, данный момент презентации отлично подходит для того, чтобы вспомнить уход технологии Optane. Концепция Infinite Memory напрямую связана со сценариями использования KV-кэша. Когда префикс зафиксирован и постоянно находится в памяти, XCENA демонстрирует время до выдачи первого токена (TTFT), сопоставимое с DRAM с небольшим коэффициентом 1,13x. Отказ от фиксации увеличивает этот показатель до 1,57x, в то время как базовая работа на чистом SSD дает 1,86x. Применение упреждающей выборки (lookahead prefetch), задействующей простаивающие ресурсы устройства, обеспечивает производительность, практически неотличимую от работы непосредственно в DRAM. Данный тест выполняется на модели LLaMA-3.1-8B в связке с vLLM, LMCache и графическим ускорителем NVIDIA RTX 6000 Pro, что выглядит весьма перспективным сценарием применения.
Вторая часть выступления переключает внимание на исследования Samsung в области вычислений вблизи памяти с использованием архитектуры MX1. Анализ компании строится на задействовании колоссальной пропускной способности DRAM, скрытой за интерфейсом CXL, посредством вычислений на месте и передачи исключительно сокращенных объемов данных. Для наглядности приводится сравнение пропускной способности DDR5 на уровне 268,8 ГБ/с с хост-ликом PCIe Gen6 x8, обеспечивающим 64 ГБ/с. Появление интерфейса PCIe Gen6 x8 косвенно указывает на актуальные сроки реализации проекта, учитывая, что рынок серверных процессоров с поддержкой этого стандарта только начинает формироваться. Представители Samsung со сцены подтвердили, что технология CXL активно внедряется всеми крупнейшими гиперскейлерами для задач вроде баз данных, искусственного интеллекта и работы с KV-кэшем.
Совместно с XCENA компания Samsung обрисовывает контуры стоечной вычислительной системы памяти на базе CXL, в которой серверы с графическими процессорами разделяют единое адресное пространство через семантику памяти CXL. Эта эталонная аппаратная платформа объединяет коммутатор Liqid CXL и GPU-серверы с картами NVIDIA RTX Pro 6000 Blackwell на 96 ГБ, нацеливаясь на создание емкости памяти до 20 ТБ при пропускной способности 2,7 ТБ/с. Samsung поставляет API NDC — библиотеку вычислений вблизи данных, которая позиционируется как независимая от конкретного вендора и распространяется с открытым исходным кодом через инициативу OCP FTI DCC. Интеграцию с фреймворком PyTorch компания реализует через OpenXLA и PrivateUse1, благодаря чему любой ИИ-фреймворк получает доступ к библиотеке XCENA PXL без необходимости изменения исходного кода.
Первый реальный сценарий применения в сфере искусственного интеллекта от Samsung связан с векторным поиском RAG на базе CXL-PNM с использованием индексации IVF Flat из библиотеки FAISS, где ресурсоемкие вычисления L2 kNN-расстояний перекладываются на ускоритель из-за ограничений пропускной способности памяти. По данным Samsung, десять устройств PNM обеспечивают в 64 раза больше запросов в секунду по сравнению с традиционным хост-процессором, использующим пул памяти CXL, а энергоэффективность запросов возрастает в 65 раз на основе индекса FAISS из 512 миллионов векторов, взятого из массива Laion 5B.
Вторым сценарием выступает декодирование больших языковых моделей (LLM) с гибридным механизмом внимания (hybrid attention), объединяющим GPU и PNM. Такой гибридный подход удерживает актуальные страницы на графическом ускорителе, а страницы, вызвавшие промах кэша, перенаправляет на устройство PNM, которое возвращает исключительно результат вычислений механизма внимания, избавляя систему от необходимости пересылать страницы KV-кэша обратно. Хронология процесса декодирования в данном случае противопоставляет чисто GPU-ориентированное внимание, загружающее KV-кэш из CXL, гибридному маршруту, разгружающему операции при промахах.
Ключевыми результатами Samsung для гибридного пути декодирования стали впечатляющие метрики. При контексте в 100 тысяч токенов пул PNM увеличивает пропускную способность в 3,35 раза, а показатель токенов на единицу энергии — в 3,84 раза, что выражается в значениях 17,7 против 5,50 токена в секунду и 4,31 против 1,12 токена на килоджоуль соответственно. Для этого теста специалисты Samsung задействовали модель LLaMA-3.1-70B INT8, распределенную между двумя серверами, каждый из которых был укомплектован пятью устройствами MX1 и графическими процессорами NVIDIA RTX Pro 6000 Blackwell. В совокупности XCENA и Samsung позиционируют аппаратную платформу MX1 как реальный кремний, находящийся в эпицентре волны вычислительной памяти, объединяя само устройство, среду выполнения PXL, концепцию Infinite Memory и масштабируемые стоечные пулы от Samsung.
Итоги
Презентация XCENA убедительно доказывает, что главным узким местом для систем искусственного интеллекта и аналитики является именно память, а решение проблемы кроется в использовании специализированного устройства CXL, а не в наращивании мощности центрального процессора или ускорении графической карты. Подобное сочетание RISC-V вычислений вблизи памяти, байт-адресуемой памяти на базе SSD и стоечного пулинга от Samsung формирует новый уровень иерархии памяти, способный масштабировать емкость и вычислительную мощность одновременно. Будет любопытно проследить за практической реализацией этого проекта, хотя многоуровневое кэширование на базе твердотельных накопителей само по себе представляет исключительный интерес для индустрии.
Источник: servethehome.com

