Google DeepMind представила DiffusionGemma — диффузионную языковую модель, созданную на основе существующей Gemma-4-26B-A4B. Вместо обучения с нуля исследователи конвертировали готовую авторегрессионную модель в диффузионную, потратив менее десяти процентов исходного бюджета токенов. Результат — генерация со скоростью около 1500 токенов в секунду, что в несколько раз быстрее оригинальной Gemma 4 и предыдущих диффузионных моделей, при сопоставимой точности.

Диффузионные модели текста работают иначе, чем привычные авторегрессионные LLM. Авторегрессионная модель предсказывает следующее слово по цепочке, а диффузионная генерирует весь текст параллельно, постепенно убирая шум из случайного набора токенов. Это позволяет модели исправлять ошибки в процессе генерации: если на раннем этапе она выбрала неверный токен, на последующих шагах денойзинга его можно заменить. В примере из отчета Gemma 4 начинает ответ с «-1», затем осознает, что правильно «-25», и добавляет исправление в конец. DiffusionGemma же формирует ответ и рассуждение одновременно, поэтому может скорректировать ошибку до финализации вывода.

ПараметрDiffusionGemmaGemma 4 (авторегрессионная)
Скорость генерации~1500 токенов/св несколько раз ниже
Качество на reasoning-бенчмаркахнижевыше
Способность исправлять ошибкида, в процессе генерациинет, только постфактум
Решение судоку после донастройки~85%не справляется

Обучение DiffusionGemma проходило в два этапа. На первом модель училась восстанавливать зашумленные блоки текста из примеров. На втором этапе Google объединила reinforcement learning и sampler distillation в единый процесс, названный SD·RL. Reinforcement learning повышает качество ответов, а sampler distillation позволяет модели работать с меньшим числом вычислительных шагов. По данным отчета, такой комбинированный подход поднимает качество на reasoning-бенчмарках в среднем на десять пунктов и почти в четыре раза увеличивает количество токенов на вычислительный шаг. Побочный эффект — ответы DiffusionGemma примерно на 50 процентов короче, что дополнительно ускоряет генерацию.

Модель генерирует текст со скоростью около 1500 токенов в секунду, что в несколько раз быстрее Gemma 4.

DiffusionGemma delivers several times the output speed of the Gemma 4 models and previous diffusion models while maintaining comparable accuracy. | Image: Google
DiffusionGemma delivers several times the output speed of the Gemma 4 models and previous diffusion models while maintaining comparable accuracy. | Image: Google · Источник: The Decoder

Однако абсолютное качество DiffusionGemma уступает авторегрессионной базовой модели. Google объясняет это несколькими причинами: модель не обучалась как диффузионная с нуля, а была переоборудована постфактум; последующий этап обучения был относительно коротким; SD·RL приоритизировал скорость над пиковым качеством. Архитектура, обучающие данные и другие настройки также были унаследованы от Gemma 4, что не идеально для диффузии. Модель иногда зацикливается, повторяя отдельные слова, — артефакт агрессивно сокращенных вычислительных шагов. На мультимодальных задачах DiffusionGemma иногда забывает закрыть блок рассуждений, что искусственно занижает результаты бенчмарков.

Скоростное преимущество DiffusionGemma проявляется в основном в однопользовательских сценариях. При нагрузке около 32 одновременных запросов стандартные языковые модели догоняют диффузионную по пропускной способности. Тем не менее модель уже нашла применение: стартап Interfaze использует ее для многоязычного распознавания речи, а в исследовательском проекте — для интерактивной генерации радиологических отчетов. Google распространяет DiffusionGemma под лицензией Apache 2.0 на Hugging Face и позиционирует ее как экспериментальную, предназначенную для ускорения исследований в области текстовой диффузии и как основу для специализированных ресурсоэффективных адаптаций.

Диффузионные модели текста — относительно новое направление, и DiffusionGemma — одна из первых попыток применить этот подход к большим языковым моделям. Ее предшественник, Gemini Diffusion, был продемонстрирован в мае 2025 года. Пока диффузионные модели уступают авторегрессионным по качеству, но их преимущество в скорости и возможности параллельной генерации делают их перспективными для задач, где важна задержка, например в чат-ботах или инструментах для программирования. Экспериментальный статус модели и открытая лицензия позволяют сообществу исследовать ее возможности и ограничения.