Загрузка 0
ПОДЕЛИТЬСЯ

Мой блог

Листай вниз

Домашний сервер для LLM на NVIDIA Tesla V100 SXM2: собираем мощный ИИ-узел по цене игрового GPU

Домашний сервер для LLM на NVIDIA Tesla V100 SXM2: собираем мощный ИИ-узел по цене игрового GPU

Несколько лет назад флагманские графические ускорители NVIDIA Tesla V100 были эксклюзивным оснащением дата-центров и научных суперкомпьютеров. Сегодня списанные модули Tesla V100 SXM2 с объемом видеопамяти 16 и 32 ГБ массово пополняют вторичный рынок. Для всех, кто разворачивает локальный искусственный интеллект и экспериментирует с большими языковыми моделями (LLM), такие видеокарты представляют огромный практический интерес.

Почему именно NVIDIA Tesla V100

При построении домашней нейросетевой станции у меня возникла логичная идея: вместо покупки одной современной и весьма дорогой игровой видеокарты лучше собрать специализированный сервер на двух или четырех серверных ускорителях. На выходе получается внушительный массив VRAM от 64 до 128 ГБ, быстрая память, а также поддержка скоростного интерфейса NVLink для парного объединения карт. Сами модули V100 SXM2 на вторичном рынке сейчас оцениваются очень бюджетно — стартовая цена за 16-гигабайтный модуль начинается в среднем от 100–150 долларов в зависимости от состояния оборудования.

Мезонинный разъем модуля Tesla V100 SXM2
Высокоскоростной разъём SXM2, обеспечивающий питание и передачу данных по линиям PCIe и NVLink.
Двухпроцессорная материнская плата под ИИ-сервер
Материнская плата с двумя процессорами Intel Xeon для обслуживания многокарточной системы.
Блок питания мощностью 1500 Вт для нейросетевого сервера
Высокомощный блок питания, необходимый для обеспечения стабильной работы сервера при пиковых нагрузках.
Шина NVLink Bridge для объединения карт V100
Жесткий соединительный мост NVLink для связывания двух плат V100 SXM2.
Мониторинг температур и энергопотребления V100 в nvidia-smi
Мониторинг рабочих параметров, температур и распределения памяти через утилиту nvidia-smi.
Расшифровка исторической радиограммы Enigma нейросетью GPT-6 Astra
Модель GPT-6 Astra смогла разгадать 82-символьную шифрограмму Enigma 1941 года за 10 часов работы.
Домашний сервер для LLM на NVIDIA Tesla V100 SXM2: собираем мощный ИИ-узел по цене игрового GPU
Домашний сервер для LLM на NVIDIA Tesla V100 SXM2: собираем мощный ИИ-узел по цене игрового GPU
Домашний сервер для LLM на NVIDIA Tesla V100 SXM2: собираем мощный ИИ-узел по цене игрового GPU
Домашний сервер для LLM на NVIDIA Tesla V100 SXM2: собираем мощный ИИ-узел по цене игрового GPU
Домашний сервер для LLM на NVIDIA Tesla V100 SXM2: собираем мощный ИИ-узел по цене игрового GPU
Домашний сервер для LLM на NVIDIA Tesla V100 SXM2: собираем мощный ИИ-узел по цене игрового GPU
Домашний сервер для LLM на NVIDIA Tesla V100 SXM2: собираем мощный ИИ-узел по цене игрового GPU
Домашний сервер для LLM на NVIDIA Tesla V100 SXM2: собираем мощный ИИ-узел по цене игрового GPU
Домашний сервер для LLM на NVIDIA Tesla V100 SXM2: собираем мощный ИИ-узел по цене игрового GPU

Важно понимать аппаратные ограничения: видеокарты V100 базируются на микроархитектуре Volta 2017 года. Это означает, что в обычных 3D-играх ускоритель не покажет выдающихся результатов — его уровень находится в районе Radeon RX 6800 XT или GeForce RTX 4060 Ti. К тому же здесь отсутствуют поддержка аппаратного трассирования лучей и генерация кадров DLSS 3/4.

Реклама
Конфигурация сервера из нескольких карт Tesla V100 SXM2
Связка из нескольких видеокарт Tesla V100 обеспечивает внушительный массив быстрой видеопамяти HBM2.

Однако в задачах локального инференса LLM ситуация принципиально иная: здесь ключевую роль играют итоговый объем и пропускная способность памяти, а не только новизна Tensor-ядер. В нейросетевых сценариях сервер на базе NVIDIA V100 SXM2 успешно соперничает с существенно более дорогостоящими GPU, уверенно конкурируя с RTX 3090 Ti. Сборка из четырех плат V100 по 32 ГБ предоставляет 128 ГБ HBM2, что открывает возможность запускать тяжелые модели, не помещающиеся на потребительских видеокартах.

Что такое V100 SXM2

Графический чип NVIDIA Tesla V100 включает 5120 ядер CUDA и 640 специализированных Tensor-ядер. Старшая модификация SXM2 оснащается 32 ГБ памяти формата HBM2 с пропускной способностью до 900 ГБ/с. Чистая вычислительная мощность тензорных операций заявлена на уровне 125 TFLOPS при энергопотреблении до 300 Вт. Связь между картами обеспечивает мост NVLink с передачей данных со скоростью до 300 ГБ/с.

Сравнение архитектуры Volta V100 с игровыми графическими картами
Архитектура Volta эффективна в параллельных нейросетевых вычислениях, но уступает в современных видеоиграх.

Для сравнения: популярная GeForce RTX 3090 предлагает 24 ГБ GDDR6X (936 ГБ/с), RTX 5070 — 12 ГБ GDDR7 (672 ГБ/с), а RTX 4070 Ti — лишь 12 ГБ GDDR6X. По этой причине 32 ГБ быстрой памяти HBM2 на V100 остаются мощным ресурсом для запуска нейросетей.

Реклама
Запуск локальных моделей LLM на картах Tesla V100 SXM2
Высокая пропускная способность памяти HBM2 позволяет ускорить обработку токенов в локальных LLM.

Модель V100 выпускалась в двух вариантах: классическом PCIe и серверном SXM2. Для домашней сборки выгоднее брать именно SXM2. Однако нужно заранее предусмотреть программные нюансы. В частности, в свежих релизах PyTorch начиная с версии 2.11 готовые сборки под CUDA 12.8/12.9 больше не содержат поддержку архитектуры Volta (sm_70). Придется либо использовать дистрибутивы с CUDA 12.6, либо самостоятельно компилировать PyTorch из исходников.

Характеристики и кристаллы памяти HBM2 на Tesla V100 32 ГБ
Компоновка кристалла V100 с чипами HBM2, обеспечивающими скорость обмена до 900 ГБ/с.

Сам мезонинный разъем SXM2 содержит сразу две зоны контакта: одна отвечает за шину PCIe, а вторая необходима для связки видеокарт через NVLink. При подборе переходных плат крайне важно следить, чтобы разъем под NVLink Bridge был разведен на плате.

Сравнение версий V100 PCIe и SXM2 для нейросетевых платформ
Формат SXM2 требует специальных адаптеров, но предлагает более высокую скорость NVLink.

Моя конфигурация ИИ‑сервера

Модуль формата SXM2 невозможно установить напрямую в PCI Express разъем материнской платы — требуется специальная плата-адаптер. На рынке доступны переходники под одну, две или четыре карты V100, которые подсоединяются к системе через райзеры. Я обратил внимание на то, что дешевые адаптеры могут урезать пропускную способность шины до уровня PCIe x8, что накладывает ограничения на выбор материнской платы.

Переходная плата-адаптер SXM2 на PCI Express
Плата-переходник для установки серверного модуля SXM2 в стандартную материнскую плату.

Один из самых доступных вариантов — адаптеры прямого формата PCIe под V100 SXM2, укомплектованные системами воздушного охлаждения (например, кулерами от RTX 4090) и NVLink-мостом. Однако стоит учитывать, что цена хорошего переходника сегодня может приближаться к стоимости самого ускорителя V100.

Адаптер V100 SXM2 с кулерами от RTX 4090 и мостом NVLink
Кастомная сборка с массивными кулерами и установленным мостиком NVLink Bridge.

Охлаждение — главная проблема домашней V100

Воздушный обдув для серверной платы — экстремальное решение. У V100 нет стандартного потребительского кулера: чип расчитан на мощные продувные вентиляторы внутри серверной стойки. При TDP в 300 Вт одна плата выделяет огромное количество тепла. Пара ускорителей V100 выделяет 600 Вт, а четыре карты вместе с двухпроцессорной платформой Xeon легко забирают свыше 1,5 кВт.

Использование обычных процессорных кулеров здесь не поможет. Для стабильной и тихой работы сборки из нескольких карт единственным разумным вариантом становится система жидкостного охлаждения (СЖО). Водоблоки под мезонинный разъем SXM2 плотно прилегают к ровной поверхности крышки V100, а двухсекционная СЖО позволяет без лишнего шума отводить 300 Вт тепла с каждого ускорителя.

Реклама
Проблема тепловыделения и радиатор для V100 SXM2
Высокое тепловыделение в 300 Вт требует массивных радиаторов и продуманного воздушного потока.

Сервер на двух V100 SXM2

В качестве стартовой конфигурации для дома я рекомендую связку из двух ускорителей. С двумя картами по 16 ГБ мы получаем 32 ГБ VRAM, а с версиями на 32 ГБ — суммарные 64 ГБ видеопамяти и скорость обмена до 1800 ГБ/с по NVLink. Этого с запасом хватает для запуска актуальных локальных моделей уровня Qwen3.8–27B и Gemma4-26b. Разумеется, нужно заложить мощный блок питания (от 1 кВт) и солидный объем системной ОЗУ.

Система жидкостного охлаждения СЖО для двух V100 SXM2
Использование водоблоков позволяет собрать тихий домашний сервер с эффективным отводом тепла.

Сколько стоит такая система

Финансовая составляющая проекта выглядит весьма выгодно. Плата V100 SXM2 32 ГБ стоит порядка $100–150, адаптер SXM2->PCIe — в районе $220. Для сравнения, новая RTX 5070 обходится в $550–570, б/у RTX 4070 Ti — от $680, а популярная под ИИ-задачи RTX 3090 с 24 ГБ удерживает цену выше $1000.

Водоблок СЖО на кристаллической крышке V100 SXM2
Медный водоблок СЖО, закрепленный на чипе V100 с помощью крепления стандарта LGA 115x.

Сводная смета полного сервера с учетом платформы, процессоров, ОЗУ, корпуса и СЖО:

Сборка сервера на двух картах Tesla V100 SXM2
Конфигурация из двух карт V100 предоставляет 64 ГБ видеопамяти под требовательные модели.
  • 2x V100 16 ГБ: ~$1400 (GPU $240 + переходники $240 + платформа $900)
  • 2x V100 32 ГБ: ~$1600 (GPU $460 + переходники $240 + платформа $900)
  • 4x V100 32 ГБ: ~$2700 (GPU $920 + переходники $480 + платформа $1300)
  • 4x RTX 5070: ~$3490
  • 4x RTX 4070 Ti: ~$3980
  • 4x RTX 3090: ~$6700

По соотношению вычисляемых токенов в секунду на каждые $1000 затрат связка из 4x V100 32 ГБ оказывается безусловным лидером, выдавая порядка 107 токенов/с на $1000 против 30 токенов/с у системы на RTX 3090.

Тестирование модели Qwen3.8-27B на ускорителе V100 32 ГБ
Скорость вывода модели Qwen3.8-27B достигает 36,6 токенов в секунду при квантовании Q4_K_M.

Что показали тесты Qwen3.8

В практическом тестировании локальных нейросетей Qwen3.8–27B и Gemma4-26b с квантованием Q4_K_M ускоритель V100 32 ГБ демонстрирует скорость генерации около 36,6 токена в секунду. Модель требует порядка 24 ГБ видеопамяти и полностью помещается в VRAM одного чипа.

Завершающий обзор домашнего сервера на Tesla V100 SXM2
Бюджетный сервер на базе Tesla V100 — отличное решение для энтузиастов локального ИИ.

Я использую рабочую связку из Qwen3.8, Ollama и OpenCode. При помощи MCP-протоколов эта система позволяет мне автоматически генерировать 3D-объекты в Blender и работать с кодом через Arduino CLI.

Вместо итога

Сборка на базе двух V100 32 ГБ позволяет не задумываться об ограничениях памяти в 12 или 16 ГБ. Тем не менее перед покупкой стоит взвесить основные нюансы:

  • Риск износа: большинство карт выпущено в 2017–2018 годах и работало в дата-центрах.
  • Софт и драйверы: требуется установка модифицированных драйверов NVIDIA и ручная настройка окружения.
  • Энергопотребление: сборка из четырех карт потребляет до 1,5 кВт и требует мощного охлаждения.
  • Нюансы NVLink: разделение моделей по двум картам не равноценно единому монолитному кристаллу. При нехватке VRAM сброс слоев в RAM приводит к падению скорости.
  • Игры: карты не предназначены для 3D-гейминга.

Тем не менее, Tesla V100 SXM2 предоставляет рекордный объем GPU-памяти за минимальный бюджет. Для домашнего ИИ-сервера это одно из самых разумных решений на вторичном рынке.

GPT-6 Astra помогла прочесть зашифрованную Enigma немецкую радиограмму 1941 года — над ней бились 21 год

Интересной новостью из мира ИИ стала успешная дешифровка немецкой военной радиограммы MVUEH от 10 июля 1941 года. Журналист Картер Леффен с помощью нейросети GPT-6 Astra в режиме Extra High смог разгадать шифр из 82 символов, хранившийся в проекте CryptoCellar. С 2005 года криптоаналитики и специалисты по машин Enigma не могли подобать к нему ключ. Нейросети потребовалось порядка 10 часов автономной работы для полного анализа источников, подбора шифроключа и успешного прочтения сообщения.

Источник: habr.com

01.