Загрузка 0
ПОДЕЛИТЬСЯ

Мой блог

Листай вниз

Обзор мини-ПК FEVM на Ryzen AI Max+ 395: 128 ГБ объединённой памяти для локальных ИИ-моделей

Обзор мини-ПК FEVM на Ryzen AI Max+ 395: 128 ГБ объединённой памяти для локальных ИИ-моделей

Продолжаю цикл разборов компактного железа, оптимизированного под локальный запуск нейросетей. По вашей наводке я изучил инженерные особенности и реальную производительность крайне интересного устройства — мини-ПК от бренда FEVM на базе гибридного процессора AMD Ryzen AI Max+ 395 (архитектура Strix Halo).

Напомню, что сама компания AMD анонсировала флагманское семейство Strix Halo в начале 2025 года на выставке CES. Первые серийные системы от китайских фабрик начали отгружаться на локальном рынке весной, однако конфигурации с максимальным объёмом распаянной памяти в 128 ГБ добрались до маркетплейсов вроде Ozon Global и локальных импортёров ближе к концу года. Я детально проанализировал аппаратную архитектуру этого устройства, изучил замеры сообщества и свёл всю ключевую фактуру воедино.

Система охлаждения мини-ПК FEVM с испарительной камерой и двумя вентиляторами
Медная испарительная камера и двойной радиатор отводят до 150 Вт тепла в максимальном режиме.

Архитектура Strix Halo и компоновка платы FEVM

Китайский бренд FEVM (Shenzhen Feimin Technology) специализируется на проектировании малогабаритных рабочих станций. В случае с топовым решением на базе Strix Halo инженеры смогли упаковать производительную платформу в цельнометаллический алюминиевый корпус объёмом ровно в 1 литр.

Реклама

В качестве вычислительного сердца системы выступает чип AMD Ryzen AI Max+ 395. Его структура включает два восьмиядерных чиплета на архитектуре Zen 5 (в сумме мы получаем 16 ядер, 32 потока, максимальную частоту до 5.1 ГГц и 64 МБ кэш-памяти L3), а также крупный кристалл ввода-вывода с графическим ядром Radeon 8060S. Графическая подсистема содержит 40 вычислительных блоков (CU) RDNA 3.5, что эквивалентно 2560 потоковым процессорам. По чистой графической мощности этот блок сопоставим с дискретной мобильной видеокартой NVIDIA GeForce RTX 4070 Laptop.

Главная особенность этой сборки заключается в оперативной памяти: на плате распаяно 128 ГБ высокоскоростной LPDDR5X-8000. За счёт 256-битной шины (восемь независимых 32-битных каналов) достигается пиковая пропускная способность в 256 ГБ/с.

Для задач локального инференса больших языковых моделей такая компоновка имеет принципиальное значение. В операционной системе Linux с помощью параметров драйвера amdgpu и точечной настройки пула TTM/GTT под буфер весов нейросети удаётся отвести от 110 до 112 ГБ. В среде Windows через настройки UMA в BIOS видеопамяти доступно до 96 ГБ. В результате на компактной машине становятся доступны для запуска тяжёлые языковые модели, для которых ранее требовались либо специализированные серверные ускорители, либо связки из двух десктопных видеокарт уровня RTX 3090 или RTX 4090 по 24 ГБ VRAM каждая.

Реклама
Графическое ядро Radeon 8060S и архитектура gfx1151 в инференсе больших языковых моделей
Расчёты локальных ИИ-моделей выполняются шейдерными блоками Radeon 8060S, пока NPU не задействован в llama.cpp.

По интерфейсам FEVM предложила оснащение, которого часто не хватает в компактных ПК. Наряду со скоростным портом USB4 (40 Гбит/с) и двумя разъёмами M.2 2280 NVMe PCIe 4.0 для накопителей, на корпус выведен прямой порт OCuLink (PCIe 4.0 x4). Это позволяет подключать внешние видеокарты напрямую к линиям процессора без задержек и потерь на конвертацию протоколов.

Физика шины против маркетинга

Маркетинговые материалы традиционно привлекают внимание заявлениями о возможности запуска языковых моделей объёмом 200 миллиардов параметров и более. Однако на практике важно понимать физические ограничения шины памяти.

Запустить квантованную MoE-модель (Mixture of Experts), например Qwen3-235B-A22B, на этой конфигурации действительно можно. Файл весов в 4-битном квантовании (Q4_K_M) занимает около 100–110 ГБ и полностью помещается в доступный пул памяти. Но следует учитывать, что 235 миллиардов — это совокупный объём параметров. При генерации каждого отдельного токена вычисления затрагивают только активных экспертов, что составляет порядка 21–22 миллиардов параметров. В связке Linux, ROCm 7.x и библиотеки llama.cpp при пропускной способности 256 ГБ/с скорость вывода держится в районе 10–13 токенов в секунду.

Для классических плотных (Dense) нейросетей скорость напрямую ограничена пропускной способностью подсистемы памяти:

  • Модели класса 70B (такие как Llama 3 70B или Qwen 2.5 72B в кванте Q4_K_M объёмом около 40–42 ГБ) выдают от 5.5 до 7.5 токенов в секунду.
  • Модели класса 32B (например, Qwen 2.5 32B Q4_K_M весом ~20 ГБ) работают со скоростью 10–12 токенов в секунду.
  • Модели на 14B развивают темп в районе 22–26 токенов в секунду.
  • Компактные сетки на 7B–8B достигают отметки в 40–48 токенов в секунду.

В интерактивном диалоговом режиме темп 6–7 токенов в секунду на 70B-модели воспринимается вполне комфортно — текст выводится примерно со скоростью неспешного чтения. Однако для фонового автодополнения кода агентами или параллельной обработки длительных контекстов в сотни тысяч токенов эта скорость ощутимо уступает стационарным системам с дискретными видеокартами на памяти GDDR6X или HBM.

Что касается встроенного нейромодуля NPU с заявленной производительностью 50 TOPS: в актуальных версиях llama.cpp, Ollama и vLLM блок AMD XDNA 2 для инференса больших языковых моделей сейчас не задействован. Вся вычислительная нагрузка ложится исключительно на шейдерные блоки Radeon 8060S (архитектура gfx1151).

Реклама

Охлаждение и лимиты мощности

Упаковка столь мощной начинки в однолитровый корпус предъявляет жесткие требования к системе охлаждения. Тепловой пакет процессора Ryzen AI Max+ 395 настраивается в диапазоне cTDP от 55 до 120 Вт, но при максимальной одновременной нагрузке на ядра Zen 5 и 40 графических блоков RDNA 3.5 пиковое энергопотребление чипа доходит до 140–150 Вт.

Инженеры FEVM установили медную испарительную камеру, фазовый термоинтерфейс и спаренный радиатор с двумя центробежными вентиляторами. В стандартном сбалансированном профиле Balanced (лимит 85–100 Вт) температуры кристалла стабилизируются на отметке 80–86 градусов при уровне шума порядка 38–40 дБ.

В производительном режим Performance (лимит 130–150 Вт) под непрерывной нагрузкой температура ядра поднимается до 92–95 градусов, а шум турбин возрастает до 47–49 дБ. В условиях жилой комнаты такой уровень шума весьма ощутим — физику компактных кулеров не обмануть.

Кризис кремния, рост цен на память и нюансы заказа в РФ

На этапе первых анонсов производители рассчитывали на ценник в районе 1500–1600 долларов за базовые комплекты. Однако в планы вмешался глобальный рост цен на мобильную память высокой плотности. Из-за спроса на кремний со стороны ИИ-индустрии чипы LPDDR5X-8000 ощутимо подорожали у производителей DRAM.

К моменту появления стабильных партий в РФ стоимость конфигурации FEVM со 128 ГБ памяти поднялась: на Ozon Global и через каналы параллельного импорта за устройство просят от 230 000 до 280 000 рублей.

При покупке важно принимать во внимание два момента:

  1. Таможенная пошлина РФ. Для зарубежных посылок дороже 200 евро действует ставка 15% с суммы превышения. При чеке порядка 240 000 рублей доплата таможне на этапе оформления составит около 30 000–35 000 рублей.
  2. Риск мошенничества. С учётом цен на компоненты себестоимость одной лишь распаянной платы со 128 ГБ LPDDR5X сейчас приближается к двум тысячам долларов. Если вам попадается предложение за 50 000–90 000 рублей, это стопроцентный фейк от продавцов-однодневок.

Кому реально подходит данная конфигурация

Если вам требуется портативная система для тестирования и запуска тяжёлых моделей на 70B параметров с широким контекстом, вы работаете под Linux и не готовы переплачивать за Mac Studio — FEVM на Ryzen AI Max+ 395 решает эту задачу даже с учётом подорожавшей памяти.

Если ваш рабочий процесс завязан на дообучение сеток, библиотеки с привязкой к CUDA или выработку миллионов токенов в сутки — альтернативы полноразмерному десктопу с парой видеокарт NVIDIA по-прежнему нет.

Когда же рабочий стек ограничен моделями на 8B–14B параметров, переплачивать почти 300 тысяч рублей за 128 ГБ распаянной LPDDR5X нет никакого смысла: с этими задачами справится базовый мини-ПК на обычном Ryzen 7 со сменными планками памяти.

Я рассматриваю данный мини-ПК в качестве одного из основных кандидатов на замену своего десктопа. Если решусь на покупку, обязательно опуликую подробный практический опыт эксплуатации.

Источник: habr.com

01.