7 августа 2026 года AMD объявила о приобретении канадского стартапа Taalas, который разрабатывает специализированные чипы для инференса ИИ-моделей. Taalas была основана в Торонто в 2023 году и вышла из стелса в феврале с необычным подходом: компания встраивает архитектуру и обученные параметры модели непосредственно в кремний. Это позволяет достичь экстремальной скорости инференса, но привязывает каждый чип к одной конкретной модели.
Демонстрационный чип Taalas, работающий с Llama 3.1-8B, показал скорость более 16 000 токенов в секунду на пользователя — это в несколько раз быстрее, чем у конкурирующего оборудования. Такой результат достигается за счет того, что модель фактически «зашита» в аппаратное обеспечение, что исключает накладные расходы на загрузку весов и выполнение общих вычислений. Однако обратная сторона такого подхода — отсутствие гибкости: чип нельзя перенастроить на другую модель без перепроектирования.
AMD планирует интегрировать технологию Taalas в свою дорожную карту ускорителей и предлагать ее вместе с GPU Instinct как системное решение. Вамси Боппана, старший вице-президент ИИ-подразделения AMD, заявил, что сделка укрепляет ИИ-портфель компании. Сооснователь Taalas Любиша Байич отметил, что AMD предоставляет стартапу масштаб и охват, необходимые для развития. Сделка подлежит стандартным регуляторным одобрениям.
Taalas встраивает архитектуру и веса модели прямо в чип, что обеспечивает высокую скорость, но привязывает чип к одной модели.

Это приобретение отражает растущий тренд на специализированные чипы для инференса, которые оптимизированы под конкретные модели. По данным источников, Google также работает над подобным чипом для Gemini. Для AMD это шаг к диверсификации предложения в области ИИ-инфраструктуры, где доминируют GPU, но появляется ниша для ASIC-решений, обеспечивающих максимальную производительность для фиксированных моделей.
Для конечных пользователей это означает потенциальное снижение стоимости инференса для популярных открытых моделей, таких как Llama, но с ограничением на использование только одной модели на чипе. В перспективе такие чипы могут быть востребованы в сценариях, где требуется максимальная скорость и предсказуемая нагрузка, например, в реальном времени или в дата-центрах с фиксированным набором моделей.



