Загрузка 0
ПОДЕЛИТЬСЯ

Мой блог

Листай вниз

NVIDIA выпустила TensorRT Model Connect: конвертация чейкпоинтов Hugging Face в нативный C++

NVIDIA выпустила TensorRT Model Connect: конвертация чейкпоинтов Hugging Face в нативный C++

Компания NVIDIA представила публичную предварительную версию TensorRT Model Connect (TRTMC). Это открытый программный проект, который позволяет перевести поддерживаемый чекпоинт из репозитория Hugging Face или с локального диска в полноценный процесс инференса TensorRT всего за две команды. Важной особенностью процесса является то, что он полностью обходит промежуточный этап экспорта в формат ONNX. В результате сборки формируется версионированный артефакт в виде файла с расширением .bundle, который запускается через нативные программные интерфейсы задач на C++. Такой подход позволяет выполнять инференс напрямую в составе C++ сервиса, встраиваемого программного обеспечения или робототехнического стека, причем наличие интерпретатора PyTorch в среде исполнения больше не требуется.

Проект распространяется на условиях лицензии Apache-2.0 и представляет собой набор специализированных эталонных реализаций под конкретные семейства моделей, а не некий универсальный конвертер общего назначения. Разработчики также отдельно подчеркивают интересный факт: вся кодовая база проекта, включая реализации архитектур моделей, настройку производительности, тестовые сценарии, интеграции и документацию, была создана с помощью ИИ-агентов OpenAI Codex под непосредственным руководством и контролем людей.

Is it deployable?

Программное обеспечение полностью готово к практическому применению в задачах оценки и нативной интеграции, однако накладывает определенные реальные условия. Сам код открыт и доступен для установки, но на текущий момент готовые пакеты колес (wheels) выпускаются исключительно под целевую аппаратную платформу Linux aarch64. Для их работы требуются Python версии 3.10 или 3.12, системная библиотека glibc версии 2.39 или новее, а также установленный TensorRT 11.1.0.106. Готовые бинарные сборки для архитектуры x86_64 пока отсутствуют, поэтому пользователям таких систем приходится собирать проект из исходного кода через Docker.

Оценка применимости по уровням и направлениям:

  • Уровень компаний: инструмент лучше всего подходит командам, которые уже располагают собственным отлаженным стеком инференса. Это могут быть технологические стартапы, ориентированные на экосистему NVIDIA, компании из сферы робототехники и производства устройств, а также специализированные платформенные подразделения в средних и крупных корпорациях. Небольшим командам, выпускающим сервисы исключительно на Python, этот инструмент принесет меньше пользы. Регулируемым корпорациям перед внедрением в стандарты разработки рекомендуется дождаться официального стабильного релиза.
  • Отрасли: робототехника и автономные машины, промышленный контроль качества и производство, бортовые вычислительные комплексы автомобилей, медицинские приборы, оборонные и аэрокосмические периферийные системы, а также медиаиндустрия — словом, любые сферы, где инференс должен выполняться внутри скомпилированного C++ бинарника, а не на Python-сервере.
  • Приложения: генерация текста на устройстве, системы распознавания и синтеза речи, оптическое распознавание символов (OCR) и парсинг документов, расчет эмбеддингов и ранжирование для поисковых систем на C++, диффузионная генерация изображений и видео, сегментация данных, а также прогнозирование временных рядов.

The two commands

Ускоренный запуск и сборка модели Qwen3-0.6B демонстрируют всю простоту рабочего процесса. Первый этап выполняется одной командой для сборки:

trtmc build Qwen/Qwen3-0.6B --precision bf16 --max-cache-length 16384 --output qwen3-0.6b.bundle

Сразу после этого модель можно запустить второй командой:

trtmc run ./qwen3-0.6b.bundle --prompt "What is the capital of France? Answer in one word." --chat-template --no-thinking

Аналогичным образом созданный файл бандла загружается в C++ код с помощью вызова функции trtmc::load("./qwen3-0.6b.bundle").

The bundle is the actual design decision

Архитектурно TRTMC разделяет фазу сборки и этап выполнения на уровне версионированного артефакта. Среда Python берет на себя разрешение чекпоинтов и построение движка TensorRT. После этого нативные профили выполняют инференс на C++ без привлечения компонентов PyTorch. Лишь в небольшом числе гибридных профилей задействуется вспомогательный исполняемый модуль Python, причем манифесты таких конфигураций явно декларируют эту зависимость.

Прикладные приложения обращаются к стандартным интерфейсам задач — таким как generate(), transcribe(), generate_image(), embed() или solve(). Это избавляет разработчиков от необходимости самостоятельно поддерживать этапы конвертации и громоздкую связующую логику для каждой отдельной модели. Специальная команда trtmc inspect позволяет получить полную информацию о типе бандла, семействе модели, точности вычислений, исполняемой среде и используемых движках, делая артефакт полностью прозрачным для аудита.

В NVIDIA отмечают, что традиционный путь развертывания выглядел как цепочка «PyTorch → ONNX или TorchScript → TensorRT → специализированная C++ интеграция для конкретной модели». Новый инструмент устраняет типичные слабые места этого подхода: провалы при экспорте, необходимость постоянной переделки интеграций под каждую модель и разброс проверок качества по разным промежуточным артефактам конвертации.

Key Takeaways

  • Всего две команды переводят поддерживаемый чекпоинт Hugging Face в нативный C++ инференс TensorRT без прохождения этапа ONNX.
  • Версионированный файл артефакта выступает в роли понятной точки передачи между этапом сборки на Python и средой выполнения на C++, свободной от зависимостей PyTorch.
  • Срез данных для версии GB300 от 29 июля 2026 года охватывает 105 профилей, распределенных по 76 семействам моделей, причем 102 профиля превосходят заявленные эталонные показатели более чем на 5%.
  • На сегодняшний день готовые пакеты распространяются только для платформы Linux aarch64, тогда как для архитектур x86_64 требуется самостоятельная сборка из исходного кода через Docker.

Источник: marktechpost.com

Оставить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

01.
На платформе MonsterInsights