Мой блог
Французский стартап Kog ускоряет работу LLM на GPU

Гонка за создание максимально быстрых систем инференса ИИ идет полным ходом, и майское IPO компании Cerebras, производящей специализированные чипы, стало ярким тому подтверждением. Однако французский стартап Kog придерживается альтернативного мнения: разработчики уверены, что стандартные графические процессоры (GPU), которые уже установлены в центрах обработки данных, скрывают в себе гораздо больше мощности, чем принято считать. В мае проект привлек внимание сообщества Hacker News, опубликовав технический превью-релиз, призванный доказать, что экстремально быстрая декодировка одиночных запросов вполне достижима на массовом оборудовании вроде AMD MI300X и Nvidia H200.

Стандартные GPU против специализированных решений
Хотя некоторые пользователи были разочарованы тем, что технология Kog пока не распространяется на GPU в обычных ноутбуках, многие эксперты разглядели в этом подходе серьезный потенциал. Учитывая, что скорость инференса и сопутствующие расходы стали критическим барьером для масштабирования ИИ, обещание раскрыть новые возможности на уже имеющемся «железе» привлекло внимание профессиональной аудитории. Гаэль Деллалло, основатель и CEO стартапа, сообщил, что компания уже получила порядка 200 потенциальных бизнес-лидов.
Согласно первоначальным отзывам, основной запрос рынка исходит от сферы разработки ПО. Пользователи профессиональных инструментов, таких как Claude Code, часто сталкиваются с необходимостью часового ожидания результатов. Anthropic осознает ценность скорости, взимая повышенную плату за «Fast Mode», и Kog стремится привлечь клиентов, для которых такие задержки неприемлемы. Кроме того, стартап работает с дизайн-партнерами, создающими игры и приложения с помощью промптов, для которых сокращение времени генерации напрямую транслируется в рост выручки.
Адаптация под запросы рынка и вызов для LLM
В ходе общения с потенциальными клиентами стартап обнаружил, что рынок еще недостаточно зрел: заказчики в массе своей не готовы самостоятельно заниматься дообучением небольших нейросетей. «Именно поэтому после запуска мы сосредоточились на ускорении разработки более крупных моделей, чтобы удовлетворить существующий спрос», — поясняет Деллалло. Это ставит перед компанией амбициозную задачу — подтвердить обещание по «30-кратному ускорению инференса LLM».
Демонстрация Kog показала впечатляющие 3000 токенов в секунду, но этот результат был достигнут на Laneformer 2B — специализированной модели с двумя миллиардами параметров, исходный код которой теперь открыт. Несмотря на скепсис, Деллалло уверен, что тот же подход сработает и с полноценными LLM, размер которых обычно становится проблемой для специализированных чипов. По мнению главы Kog, идея о непригодности GPU для эффективного декодирования — это ошибочное мнение, так как пропускная способность памяти в современных графических процессорах лишь ждет, когда ее «разблокируют» программными методами.
Инженерная школа и философия «хакерства»
Kog не единственная компания, работающая в этом направлении: например, французская ZML разрабатывает независимый от оборудования софт, обходящий Nvidia CUDA. Однако Деллалло подчеркивает, что идеологически Kog ближе к лаборатории Hazy Research из Стэнфорда с ее предельно глубоким уровнем работы над GPU-акселерацией. Сам Деллалло — не академический исследователь; его предпринимательский путь начался еще с участия в проектах вроде Stribe, а в нынешней работе ему помогает Камель Зеруаль из Varsity VC, соинвестор посевного раунда Kog.
Уникальный бэкграунд CEO, изучавшего физику твердого тела в École Polytechnique и работавшего в сфере наступательной кибербезопасности, предопределил методы команды. Как четырехкратный финалист турниров DEFCON CTF, Деллалло прививает коллегам культуру реверс-инжиниринга: «Нужно разбирать всё на низком уровне — вплоть до ассемблера и бинарного кода, чтобы понять, как система работает на самом деле, и заставить ее делать то, для чего она изначально не предназначалась». Такой подход, однако, крайне ресурсозатратен: адаптация под каждый новый GPU занимает несколько недель или даже месяцев кропотливой работы инженеров.
Масштабирование и планы на будущее
Учитывая команду из 11 человек, количество поддерживаемых чипов ограничено, но в долгосрочной перспективе Kog планирует внедрить методологию в агентные конвейеры для автоматизированной поддержки большего спектра оборудования. Стартап получает поддержку от Scaleway и государственных программ Bpifrance и French Tech 2030, что играет на руку идеям технологического суверенитета Европы. Сейчас ключевая задача для привлечения раунда Series A — доказать эффективность подхода на крупных моделях. Деллалло ожидает, что реализация первого крупного проекта с 10-кратным ускорением состоится уже в сентябре, что станет необходимым подтверждением востребованности технологии для инвесторов.

Источник: techcrunch.com

