Мой блог
Домашний сервер для LLM на NVIDIA Tesla V100 SXM2: собираем мощный ИИ-узел по цене игрового GPU
Несколько лет назад флагманские графические ускорители NVIDIA Tesla V100 были эксклюзивным оснащением дата-центров и научных суперкомпьютеров. Сегодня списанные модули Tesla V100 SXM2 с объемом видеопамяти 16 и 32 ГБ массово пополняют вторичный рынок. Для всех, кто разворачивает локальный искусственный интеллект и экспериментирует с большими языковыми моделями (LLM), такие видеокарты представляют огромный практический интерес.
Почему именно NVIDIA Tesla V100
При построении домашней нейросетевой станции у меня возникла логичная идея: вместо покупки одной современной и весьма дорогой игровой видеокарты лучше собрать специализированный сервер на двух или четырех серверных ускорителях. На выходе получается внушительный массив VRAM от 64 до 128 ГБ, быстрая память, а также поддержка скоростного интерфейса NVLink для парного объединения карт. Сами модули V100 SXM2 на вторичном рынке сейчас оцениваются очень бюджетно — стартовая цена за 16-гигабайтный модуль начинается в среднем от 100–150 долларов в зависимости от состояния оборудования.














Важно понимать аппаратные ограничения: видеокарты V100 базируются на микроархитектуре Volta 2017 года. Это означает, что в обычных 3D-играх ускоритель не покажет выдающихся результатов — его уровень находится в районе Radeon RX 6800 XT или GeForce RTX 4060 Ti. К тому же здесь отсутствуют поддержка аппаратного трассирования лучей и генерация кадров DLSS 3/4.

Однако в задачах локального инференса LLM ситуация принципиально иная: здесь ключевую роль играют итоговый объем и пропускная способность памяти, а не только новизна Tensor-ядер. В нейросетевых сценариях сервер на базе NVIDIA V100 SXM2 успешно соперничает с существенно более дорогостоящими GPU, уверенно конкурируя с RTX 3090 Ti. Сборка из четырех плат V100 по 32 ГБ предоставляет 128 ГБ HBM2, что открывает возможность запускать тяжелые модели, не помещающиеся на потребительских видеокартах.
Что такое V100 SXM2
Графический чип NVIDIA Tesla V100 включает 5120 ядер CUDA и 640 специализированных Tensor-ядер. Старшая модификация SXM2 оснащается 32 ГБ памяти формата HBM2 с пропускной способностью до 900 ГБ/с. Чистая вычислительная мощность тензорных операций заявлена на уровне 125 TFLOPS при энергопотреблении до 300 Вт. Связь между картами обеспечивает мост NVLink с передачей данных со скоростью до 300 ГБ/с.

Для сравнения: популярная GeForce RTX 3090 предлагает 24 ГБ GDDR6X (936 ГБ/с), RTX 5070 — 12 ГБ GDDR7 (672 ГБ/с), а RTX 4070 Ti — лишь 12 ГБ GDDR6X. По этой причине 32 ГБ быстрой памяти HBM2 на V100 остаются мощным ресурсом для запуска нейросетей.

Модель V100 выпускалась в двух вариантах: классическом PCIe и серверном SXM2. Для домашней сборки выгоднее брать именно SXM2. Однако нужно заранее предусмотреть программные нюансы. В частности, в свежих релизах PyTorch начиная с версии 2.11 готовые сборки под CUDA 12.8/12.9 больше не содержат поддержку архитектуры Volta (sm_70). Придется либо использовать дистрибутивы с CUDA 12.6, либо самостоятельно компилировать PyTorch из исходников.

Сам мезонинный разъем SXM2 содержит сразу две зоны контакта: одна отвечает за шину PCIe, а вторая необходима для связки видеокарт через NVLink. При подборе переходных плат крайне важно следить, чтобы разъем под NVLink Bridge был разведен на плате.

Моя конфигурация ИИ‑сервера
Модуль формата SXM2 невозможно установить напрямую в PCI Express разъем материнской платы — требуется специальная плата-адаптер. На рынке доступны переходники под одну, две или четыре карты V100, которые подсоединяются к системе через райзеры. Я обратил внимание на то, что дешевые адаптеры могут урезать пропускную способность шины до уровня PCIe x8, что накладывает ограничения на выбор материнской платы.

Один из самых доступных вариантов — адаптеры прямого формата PCIe под V100 SXM2, укомплектованные системами воздушного охлаждения (например, кулерами от RTX 4090) и NVLink-мостом. Однако стоит учитывать, что цена хорошего переходника сегодня может приближаться к стоимости самого ускорителя V100.

Охлаждение — главная проблема домашней V100
Воздушный обдув для серверной платы — экстремальное решение. У V100 нет стандартного потребительского кулера: чип расчитан на мощные продувные вентиляторы внутри серверной стойки. При TDP в 300 Вт одна плата выделяет огромное количество тепла. Пара ускорителей V100 выделяет 600 Вт, а четыре карты вместе с двухпроцессорной платформой Xeon легко забирают свыше 1,5 кВт.
Использование обычных процессорных кулеров здесь не поможет. Для стабильной и тихой работы сборки из нескольких карт единственным разумным вариантом становится система жидкостного охлаждения (СЖО). Водоблоки под мезонинный разъем SXM2 плотно прилегают к ровной поверхности крышки V100, а двухсекционная СЖО позволяет без лишнего шума отводить 300 Вт тепла с каждого ускорителя.

Сервер на двух V100 SXM2
В качестве стартовой конфигурации для дома я рекомендую связку из двух ускорителей. С двумя картами по 16 ГБ мы получаем 32 ГБ VRAM, а с версиями на 32 ГБ — суммарные 64 ГБ видеопамяти и скорость обмена до 1800 ГБ/с по NVLink. Этого с запасом хватает для запуска актуальных локальных моделей уровня Qwen3.8–27B и Gemma4-26b. Разумеется, нужно заложить мощный блок питания (от 1 кВт) и солидный объем системной ОЗУ.

Сколько стоит такая система
Финансовая составляющая проекта выглядит весьма выгодно. Плата V100 SXM2 32 ГБ стоит порядка $100–150, адаптер SXM2->PCIe — в районе $220. Для сравнения, новая RTX 5070 обходится в $550–570, б/у RTX 4070 Ti — от $680, а популярная под ИИ-задачи RTX 3090 с 24 ГБ удерживает цену выше $1000.

Сводная смета полного сервера с учетом платформы, процессоров, ОЗУ, корпуса и СЖО:

- 2x V100 16 ГБ: ~$1400 (GPU $240 + переходники $240 + платформа $900)
- 2x V100 32 ГБ: ~$1600 (GPU $460 + переходники $240 + платформа $900)
- 4x V100 32 ГБ: ~$2700 (GPU $920 + переходники $480 + платформа $1300)
- 4x RTX 5070: ~$3490
- 4x RTX 4070 Ti: ~$3980
- 4x RTX 3090: ~$6700
По соотношению вычисляемых токенов в секунду на каждые $1000 затрат связка из 4x V100 32 ГБ оказывается безусловным лидером, выдавая порядка 107 токенов/с на $1000 против 30 токенов/с у системы на RTX 3090.

Что показали тесты Qwen3.8
В практическом тестировании локальных нейросетей Qwen3.8–27B и Gemma4-26b с квантованием Q4_K_M ускоритель V100 32 ГБ демонстрирует скорость генерации около 36,6 токена в секунду. Модель требует порядка 24 ГБ видеопамяти и полностью помещается в VRAM одного чипа.

Я использую рабочую связку из Qwen3.8, Ollama и OpenCode. При помощи MCP-протоколов эта система позволяет мне автоматически генерировать 3D-объекты в Blender и работать с кодом через Arduino CLI.
Вместо итога
Сборка на базе двух V100 32 ГБ позволяет не задумываться об ограничениях памяти в 12 или 16 ГБ. Тем не менее перед покупкой стоит взвесить основные нюансы:
- Риск износа: большинство карт выпущено в 2017–2018 годах и работало в дата-центрах.
- Софт и драйверы: требуется установка модифицированных драйверов NVIDIA и ручная настройка окружения.
- Энергопотребление: сборка из четырех карт потребляет до 1,5 кВт и требует мощного охлаждения.
- Нюансы NVLink: разделение моделей по двум картам не равноценно единому монолитному кристаллу. При нехватке VRAM сброс слоев в RAM приводит к падению скорости.
- Игры: карты не предназначены для 3D-гейминга.
Тем не менее, Tesla V100 SXM2 предоставляет рекордный объем GPU-памяти за минимальный бюджет. Для домашнего ИИ-сервера это одно из самых разумных решений на вторичном рынке.
GPT-6 Astra помогла прочесть зашифрованную Enigma немецкую радиограмму 1941 года — над ней бились 21 год
Интересной новостью из мира ИИ стала успешная дешифровка немецкой военной радиограммы MVUEH от 10 июля 1941 года. Журналист Картер Леффен с помощью нейросети GPT-6 Astra в режиме Extra High смог разгадать шифр из 82 символов, хранившийся в проекте CryptoCellar. С 2005 года криптоаналитики и специалисты по машин Enigma не могли подобать к нему ключ. Нейросети потребовалось порядка 10 часов автономной работы для полного анализа источников, подбора шифроключа и успешного прочтения сообщения.
Источник: habr.com
