Мой блог
Инфраструктурный барьер ИИ и запуск Qwen на RTX 5060
В индустрии высоких технологий фокус смещается с проектирования алгоритмов на обеспечение аппаратной базы. Ключевым фактором развития сектора становится именно вычислительная инфраструктура для ИИ, включающая мощные GPU-кластеры, специализированные дата-центры и независимые цепочки поставок оборудования.
Без этой основы создание отечественных генеративных моделей сталкивается с серьезными ограничениями. Эксперты отрасли подчеркивают необходимость выработки единой стратегии для преодоления зависимости от зарубежных платформ.
Контекст обсуждения и ограничения текущего этапа
Обсуждение проблем аппаратного обеспечения для нейросетей вышло на уровень крупных индустриальных площадок. Специалисты отмечают, что разработчики и бизнес сталкиваются с дефицитом серверных мощностей, который мешает развертыванию масштабных проектов. Существующие вычислительные центры не справляются с возрастающей нагрузкой, а доступ к передовому оборудованию ограничен внешними факторами.
Анализ рынка и концепция «черной дыры»
Для наглядного описания текущего состояния отрасли эксперты предлагают использовать координатную модель, напоминающую астрофизическую черную дыру. На этом графике популярность платформ сопоставляется с их технологической сложностью. В результате выделяются две зоны, где российские разработки удерживают прочные позиции.
Первая зона — это относительно простые пользовательские сценарии. Сюда относятся повседневные запросы вроде поиска кулинарных рецептов или прогнозов погоды. В этих задачах пользователи охотно выбирают отечественные сервисы, поскольку они глубоко интегрированы в привычные экосистемы и поисковые системы.

Вторая зона — это узкоспециализированные промышленные системы высокой сложности. В таких сферах, как медицина, металлургия или транспорт, локальные решения демонстрируют высокую эффективность. Это объясняется их точечной настройкой под внутренние стандарты и требования. Например, в сфере здравоохранения ИИ должен строго следовать клиническим рекомендациям Минздрава РФ, которые характерны исключительно для нашей страны, что делает зарубежные универсальные модели неприменимыми на практике.

Проблема центрального сегмента
Основная сложность возникает в середине координатной шкалы — именно там образуется так называемая просадка, или «черная дыра». В этом сегменте находятся универсальные задачи средней сложности: быстрая верстка веб-сайтов, создание несложных приложений, генерация презентаций или маркетинговых материалов.
В данной нише пользователи практически полностью зависят от зарубежных платформ вроде ChatGPT или DeepSeek. Причина кроется в отсутствии аналогичных по возможностям российских систем общего назначения. Отечественные технологические гиганты пытаются развивать свои универсальные модели, однако они упираются в технологический тупик, вызванный дефицитом подходящих серверных мощностей и графических процессоров (GPU) нужного класса.

Мировые подходы к созданию вычислительной инфраструктуры для ИИ
Анализ глобального опыта показывает два основных пути формирования необходимой технической базы для обучения нейросетей.
Западный подход опирается на частный капитал и тесную кооперацию крупнейших технологических корпораций. Из-за высокой стоимости строительства дата-центров компании создают партнерские сети и практикуют взаимообмен ресурсами. Производители чипов, поставщики электроэнергии и разработчики ПО договариваются о взаимных поставках продуктов и услуг в обход прямых денежных расчетов, что позволяет им совместно строить мощные вычислительные кластеры.

Восточный подход, характерный для Китая, базируется на партнерстве крупного бизнеса и государства. Государственные структуры напрямую поддерживают компании, создающие национальные языковые модели, и предоставляют им все необходимые преференции для развертывания инфраструктуры.
Для отечественной ИТ-индустрии выбор оптимального пути развития остается открытым вопросом, требующим консолидации усилий всех участников рынка, а не конкуренции отдельных компаний между собой.

Технический эксперимент: запуск Qwen 27B на локальном железе
Параллельно с решением глобальных инфраструктурных задач разработчики ищут способы оптимизации вычислений на уровне локальных систем. В рамках исследовательского проекта ExVRAM Lab специалисты провели тестирование возможностей по запуску крупных языковых моделей на потребительских видеокартах с небольшим объемом видеопамяти.
Основной задачей эксперимента была проверка гипотезы: можно ли полноценно запустить dense-модель Qwen 27B с 27 миллиардами параметров на видеокарте NVIDIA GeForce RTX 5060 с 8 ГБ VRAM на архитектуре Blackwell, используя методы глубокого квантования (ultra-low-bit quantization).
Суть технологии ExVRAM
Название проекта расшифровывается как Exchange Compute for VRAM («обмен вычислений на видеопамять»). Логика метода заключается в том, что в определенных сценариях экономически выгоднее задействовать свободные вычислительные блоки графического чипа для распаковки сильно сжатых весов модели прямо во время работы, чем хранить несжатые данные в медленной системной оперативной памяти (RAM) и постоянно передавать их по шине PCIe.
Ход тестирования и первые результаты
На начальном этапе эксперимента показатели были невысокими. Модель успешно запускалась, однако значительная часть ее весов (около 2,5 ГБ) оставалась в системной памяти CPU, в то время как в локальной памяти видеокарты (VRAM) размещалось лишь 5,7 ГБ. Из-за этого скорость генерации текста составляла всего от 3,8 до 5,5 токена в секунду.
При этом сам графический процессор RTX 5060 оставался недогруженным. Это подтвердило ключевое наблюдение исследователей: главным барьером производительности при локальном запуске больших моделей является пропускная способность шины PCIe, через которую веса декодера постоянно пересылались между оперативной памятью компьютера и видеокартой в процессе авторегрессионной генерации.
