Загрузка 0
ПОДЕЛИТЬСЯ

Мой блог

Листай вниз

Французский стартап Kog ускоряет работу LLM на GPU

Французский стартап Kog ускоряет работу LLM на GPU

Гонка за создание максимально быстрых систем инференса ИИ идет полным ходом, и майское IPO компании Cerebras, производящей специализированные чипы, стало ярким тому подтверждением. Однако французский стартап Kog придерживается альтернативного мнения: разработчики уверены, что стандартные графические процессоры (GPU), которые уже установлены в центрах обработки данных, скрывают в себе гораздо больше мощности, чем принято считать. В мае проект привлек внимание сообщества Hacker News, опубликовав технический превью-релиз, призванный доказать, что экстремально быстрая декодировка одиночных запросов вполне достижима на массовом оборудовании вроде AMD MI300X и Nvidia H200.

Anna Heim

Стандартные GPU против специализированных решений

Хотя некоторые пользователи были разочарованы тем, что технология Kog пока не распространяется на GPU в обычных ноутбуках, многие эксперты разглядели в этом подходе серьезный потенциал. Учитывая, что скорость инференса и сопутствующие расходы стали критическим барьером для масштабирования ИИ, обещание раскрыть новые возможности на уже имеющемся «железе» привлекло внимание профессиональной аудитории. Гаэль Деллалло, основатель и CEO стартапа, сообщил, что компания уже получила порядка 200 потенциальных бизнес-лидов.

Согласно первоначальным отзывам, основной запрос рынка исходит от сферы разработки ПО. Пользователи профессиональных инструментов, таких как Claude Code, часто сталкиваются с необходимостью часового ожидания результатов. Anthropic осознает ценность скорости, взимая повышенную плату за «Fast Mode», и Kog стремится привлечь клиентов, для которых такие задержки неприемлемы. Кроме того, стартап работает с дизайн-партнерами, создающими игры и приложения с помощью промптов, для которых сокращение времени генерации напрямую транслируется в рост выручки.

Адаптация под запросы рынка и вызов для LLM

В ходе общения с потенциальными клиентами стартап обнаружил, что рынок еще недостаточно зрел: заказчики в массе своей не готовы самостоятельно заниматься дообучением небольших нейросетей. «Именно поэтому после запуска мы сосредоточились на ускорении разработки более крупных моделей, чтобы удовлетворить существующий спрос», — поясняет Деллалло. Это ставит перед компанией амбициозную задачу — подтвердить обещание по «30-кратному ускорению инференса LLM».

Демонстрация Kog показала впечатляющие 3000 токенов в секунду, но этот результат был достигнут на Laneformer 2B — специализированной модели с двумя миллиардами параметров, исходный код которой теперь открыт. Несмотря на скепсис, Деллалло уверен, что тот же подход сработает и с полноценными LLM, размер которых обычно становится проблемой для специализированных чипов. По мнению главы Kog, идея о непригодности GPU для эффективного декодирования — это ошибочное мнение, так как пропускная способность памяти в современных графических процессорах лишь ждет, когда ее «разблокируют» программными методами.

Инженерная школа и философия «хакерства»

Kog не единственная компания, работающая в этом направлении: например, французская ZML разрабатывает независимый от оборудования софт, обходящий Nvidia CUDA. Однако Деллалло подчеркивает, что идеологически Kog ближе к лаборатории Hazy Research из Стэнфорда с ее предельно глубоким уровнем работы над GPU-акселерацией. Сам Деллалло — не академический исследователь; его предпринимательский путь начался еще с участия в проектах вроде Stribe, а в нынешней работе ему помогает Камель Зеруаль из Varsity VC, соинвестор посевного раунда Kog.

Уникальный бэкграунд CEO, изучавшего физику твердого тела в École Polytechnique и работавшего в сфере наступательной кибербезопасности, предопределил методы команды. Как четырехкратный финалист турниров DEFCON CTF, Деллалло прививает коллегам культуру реверс-инжиниринга: «Нужно разбирать всё на низком уровне — вплоть до ассемблера и бинарного кода, чтобы понять, как система работает на самом деле, и заставить ее делать то, для чего она изначально не предназначалась». Такой подход, однако, крайне ресурсозатратен: адаптация под каждый новый GPU занимает несколько недель или даже месяцев кропотливой работы инженеров.

Масштабирование и планы на будущее

Учитывая команду из 11 человек, количество поддерживаемых чипов ограничено, но в долгосрочной перспективе Kog планирует внедрить методологию в агентные конвейеры для автоматизированной поддержки большего спектра оборудования. Стартап получает поддержку от Scaleway и государственных программ Bpifrance и French Tech 2030, что играет на руку идеям технологического суверенитета Европы. Сейчас ключевая задача для привлечения раунда Series A — доказать эффективность подхода на крупных моделях. Деллалло ожидает, что реализация первого крупного проекта с 10-кратным ускорением состоится уже в сентябре, что станет необходимым подтверждением востребованности технологии для инвесторов.

Event Logo

Источник: techcrunch.com

Оставить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

01.
На платформе MonsterInsights