Kog ускоряет ИИ-инференс на обычных GPU

Французский стартап Kog делает ставку на ускорение ИИ-инференса за счёт программной оптимизации обычных GPU, а не специализированных чипов. На фоне интереса рынка к Cerebras и её IPO компания утверждает, что из существующего серверного оборудования можно получить заметно больше производительности.

В мае Kog попала на главную страницу Hacker News с техническим превью. В нём компания хотела показать, что очень быстрый декодинг одиночных запросов возможен на стандартных датацентровых GPU, которые уже используют компании, включая AMD MI300X и NVIDIA H200.

Речь не идёт о видеокартах в ноутбуках, однако идея вызвала интерес у бизнеса. По словам гендиректора Гаэля Делалло, после демонстрации компания получила 200 предметных бизнес-лидов.

Как рассказал Делалло TechCrunch, первым сценарием применения он считает разработку ПО. Пользователи Claude Code нередко ждут результат часами, а Anthropic, по его словам, понимает ценность скорости и потому берёт повышенную плату за Fast Mode.

Kog рассчитывает работать с клиентами, которых не устраивают такие задержки, особенно если ИИ-процессы используются для рабочих задач. Также у стартапа есть партнёры по дизайну продуктов, где пользователи создают игры и приложения по текстовому запросу. В таких случаях более быстрый результат через Kog Inference Engine может напрямую увеличить выручку, сказал Делалло.

При этом компания признаёт, что рынок пока сформирован не до конца. Из общения с потенциальными клиентами Kog выяснила, что они не готовы дообучать небольшие модели. Поэтому после запуска команда сосредоточилась на ускорении более крупных моделей, чтобы соответствовать увиденному спросу.

Сейчас Kog предстоит подтвердить своё обещание об ускорении инференса LLM в 30 раз. В демо компания показала около 3000 токенов в секунду на один запрос, но использовала для этого специально подготовленную небольшую модель Laneformer 2B с примерно 2 млрд параметров. Эта модель теперь опубликована в открытом доступе.

Делалло уверен, что тот же подход можно применить и к большим языковым моделям, хотя их размер создаёт нагрузку для чипов инференса. «У GPU большое будущее», — сказал он. По его мнению, представление о том, что GPU плохо подходят для декодинга, ошибочно: в новых ускорителях всё больше пропускной способности памяти, которую ещё можно использовать эффективнее.

Kog не единственная компания, которая видит потенциал в программной оптимизации GPU. Французская ZML выпустила аппаратно-независимое ПО, которое обходит CUDA от Nvidia и поддерживает быстрый инференс на конкурирующих чипах. Однако Делалло считает, что Kog ближе по подходу к лаборатории Hazy Research из Стэнфорда, поскольку занимается ускорением GPU на ещё более низком уровне.

Сам Делалло не исследователь. Его первый стартап Stribe, выпускник TechCrunch50 2009 года, не связан с нынешним проектом, кроме одного факта: бывший сооснователь Делалло Камель Зеруаль, ставший венчурным инвестором, через фонд Varsity VC совместно возглавил посевной раунд Kog.

Основатель изучал физику твёрдого тела в французской École Polytechnique, а затем работал в наступательной кибербезопасности, то есть в white hat hacking. По его словам, это сформировало подход, который он продвигает в команде: «С научной стороны это образ мышления, при котором нужно понимать законы физики и законы работы GPU, чтобы использовать их максимально эффективно».

Опытом из хакерской сферы Делалло тоже пользуется в новой компании. Четырёхкратный финалист турнира DEF CON CTF сказал, что это научило его «разбирать вещи на очень низком уровне — вплоть до ассемблера и бинарного кода, — чтобы понять, как они работают, и попытаться использовать их для задачи, для которой они изначально не предназначались».

Недостаток такого подхода в том, что он требует много ручной работы и времени. По словам Делалло, на каждый новый GPU команда тратит несколько недель или даже месяцев, чтобы глубоко изучить детали и провести инженерные исследования. В Kog сейчас 11 человек, и это ограничивает число чипов, с которыми компания может работать в ближайшее время.

В более долгой перспективе стартап рассчитывает встроить свою методику в агентные конвейеры, чтобы поддерживать больше чипов и моделей. На фоне стремления Европы развивать собственные компетенции в этих двух частях рынка это может сыграть компании на руку. Kog уже поддерживает Scaleway, а также Bpifrance и программа French Tech 2030.

Сейчас главная задача компании — доказать, что её подход работает на LLM. Это также важно для следующего раунда инвестиций. «Как только мы внедрим первую крупную модель с ускорением в 10 раз, а это, думаю, произойдёт в сентябре, мы сможем показать интерес клиентов и затем привлечь раунд Series A», — сказал Делалло.

Источник: TechCrunch.

Читать новости ИИ и технологий в Telegram.


Оцените статью
Gimal-Ai