Французский стартап Kog заявляет, что может ускорить вывод LLM на стандартных датацентровых GPU в 30 раз. В мае компания опубликовала техническое демо на Hacker News, показав 3000 токенов в секунду на модели Laneformer 2B, что привлекло 200 бизнес-лидов. Это происходит на фоне растущего спроса на быстрый и дешевый ИИ-инференс, который становится критическим узким местом для многих приложений.

Kog использует программную оптимизацию, чтобы выжать максимум из существующего оборудования, такого как AMD MI300X и Nvidia H200. Основатель и CEO Gaël Delalleau, имеющий опыт в физике твердого тела и кибербезопасности, применяет подход, схожий с обратной разработкой: он изучает архитектуру GPU на низком уровне, чтобы использовать её возможности нестандартным образом. «Мы посвящаем несколько недель или месяцев каждому новому GPU, чтобы понять его детали и провести инженерные исследования», — говорит он.

Первоначально Kog планирует сфокусироваться на ускорении программной инженерии, где пользователи часто ждут часы результатов от инструментов вроде Claude Code. Компания также работает с дизайн-партнерами, которые генерируют игры и приложения по промпту, где скорость напрямую влияет на выручку. Однако рынок ещё не зрел: клиенты не готовы дообучать маленькие модели, поэтому Kog переключилась на ускорение крупных моделей.

Демо показало 3000 токенов в секунду на модели Laneformer 2B, что в 30 раз быстрее обычного.

Демо показало впечатляющие результаты, но на модели с 2 миллиардами параметров, что вызывает скепсис относительно масштабируемости подхода на LLM. Delalleau уверен, что метод работает и для больших моделей, указывая на рост пропускной способности памяти GPU. «GPU имеют светлое будущее», — говорит он.

Kog не одинока в попытках оптимизировать GPU программно. Например, французский стартап ZML выпустил аппаратно-независимое ПО, обходящее CUDA. Но Delalleau сравнивает Kog с лабораторией Hazy Research из Стэнфорда, подчеркивая более глубокий уровень оптимизации.

Команда из 11 человек ограничивает число поддерживаемых GPU, но в перспективе Kog планирует автоматизировать процесс с помощью агентных пайплайнов. Европейский контекст добавляет «суверенные» преимущества: Kog поддерживают Scaleway, Bpifrance и French Tech 2030. Ключевой вызов — доказать эффективность на LLM, что станет основой для привлечения Series A. Delalleau ожидает продемонстрировать 10-кратное ускорение на крупной модели к сентябрю.