Google DeepMind 10 июня 2026 года выложила в открытый доступ DiffusionGemma — экспериментальную языковую модель, которая генерирует текст не последовательно, а блоками через механизм диффузии. По данным Google, модель выдаёт блок из 256 токенов параллельно за один проход вперёд и работает до 4 раз быстрее авторегрессионных аналогов. Веса распространяются под лицензией Apache 2.0, что разрешает коммерческое использование и дообучение.

Ключевые факты

  • Google DeepMind открыла DiffusionGemma 10 июня 2026 года под лицензией Apache 2.0 — первую открытую LLM на текстовой диффузии.
  • Модель — MoE на 26 млрд параметров с ~3,8 млрд активных; генерирует блок из 256 токенов параллельно за один проход вперёд, где каждый токен видит все остальные.
  • Скорость генерации до 4 раз выше авторегрессии: 1000+ токенов/с на одной NVIDIA H100 и 700+ токенов/с на потребительской RTX 5090.
  • При квантизации модель умещается в ~18 ГБ VRAM и запускается на топовых потребительских видеокартах.
  • Компромисс заявлен явно: DiffusionGemma остаётся ниже стандартной Gemma 4 на опубликованных бенчмарках, обменивая точность на скорость.

Что такое текстовая диффузия и чем она отличается от авторегрессии

Классическая LLM генерирует текст по одному токену: каждый следующий зависит от уже написанных, и проходов вперёд требуется столько же, сколько токенов в ответе. DiffusionGemma устроена иначе. По описанию DeepMind, модель берёт блок из 256 токенов и за один проход уточняет его целиком — каждый токен в блоке видит все остальные, а не только предшествующие. Подход перенесён из генерации изображений, где диффузионные модели восстанавливают картинку из шума за несколько шагов.

Практическое следствие — параллелизм. Авторегрессия упирается в длину ответа: 1000 токенов означают 1000 последовательных проходов. Диффузия обрабатывает блок за фиксированное число шагов независимо от того, сколько токенов в нём, и именно отсюда берётся прирост скорости. MarkTechPost описывает DiffusionGemma как первую открытую модель такого класса — раньше текстовая диффузия оставалась внутри исследовательских лабораторий и закрытых демо.

Архитектура и производительность

DiffusionGemma — это Mixture-of-Experts на 26 млрд параметров с примерно 3,8 млрд активных на запрос. Малое число активных параметров удерживает требования к памяти на уровне, доступном вне дата-центра.

Цифры NVIDIA важны отдельно: 700+ токенов в секунду на потребительской RTX 5090 и порог в ~18 ГБ VRAM означают, что модель запускается на топовых игровых видеокартах, а не только на серверных ускорителях. Для локального инференса это редкое сочетание скорости и доступного железа.

Выигрыш в скорости нелинеен по длине ответа. На коротких репликах разница с авторегрессией невелика — там и так мало проходов. Но чем длиннее генерация, тем сильнее расходятся кривые: авторегрессия платит за каждый новый токен отдельным проходом, а диффузия обрабатывает блоки фиксированного размера. Поэтому максимальную отдачу модель даёт на длинных выводах — генерации кода, документов, потоковых ответах, — где задержка авторегрессии накапливается быстрее всего.

Двунаправленность блока даёт и побочное свойство. Модель видит контекст с обеих сторон и может заполнять пропуски внутри блока, а не только продолжать текст слева направо. Для авторегрессии вставка в середину — неудобный сценарий; диффузия обрабатывает его естественно, что полезно при дополнении и правке кода.

Скорость в обмен на качество

Главный компромисс заявлен самой Google: DiffusionGemma остаётся ниже стандартной Gemma 4 на опубликованных бенчмарках. Скорость куплена ценой точности, и для задач, где важна максимальная аккуратность ответа, авторегрессионная Gemma 4 пока предпочтительнее.

Расстановка понятна, если смотреть на сценарии. Параллельная генерация выигрывает там, где критична задержка, а не последний процент качества: черновики, автодополнение, потоковые ответы, локальные ассистенты на одной видеокарте. Авторегрессия удерживает преимущество в задачах, где ошибка дорого стоит. По сути DeepMind предлагает не замену Gemma 4, а второй режим — для тех, кто готов обменять точность на пропускную способность. Тот же прагматизм двигал недавние открытые релизы: открытые веса GLM-5.2 и семейство Qwen3 делали ставку на стоимость и эффективность эксплуатации, а не на верхнюю строку лидерборда.

Открытость под Apache 2.0 здесь принципиальна. Текстовая диффузия до сих пор существовала в основном как академическая тема, и доступ к рабочим весам позволяет сообществу проверить, насколько разрыв с авторегрессией сокращается при дообучении. Если следующие итерации подтянут качество ближе к Gemma 4 при сохранении скорости, диффузия из эксперимента превратится в практичную альтернативу для латентно-чувствительных сценариев. Свежие релизы открытых моделей собраны в категории «Модели».

Частые вопросы

Что такое DiffusionGemma и кто её выпустил?

DiffusionGemma — экспериментальная открытая языковая модель Google DeepMind, выпущенная 10 июня 2026 года под лицензией Apache 2.0. Это первая открытая LLM на текстовой диффузии: MoE на 26 млрд параметров с ~3,8 млрд активных, которая генерирует текст блоками по 256 токенов вместо последовательной генерации по одному токену.

Чем текстовая диффузия отличается от авторегрессии?

Авторегрессионная LLM пишет текст по одному токену, и проходов вперёд нужно столько же, сколько токенов в ответе. DiffusionGemma за один проход уточняет целый блок из 256 токенов, где каждый токен видит все остальные. Подход перенесён из генерации изображений и даёт прирост скорости за счёт параллелизма.

Насколько DiffusionGemma быстрее обычных моделей?

По данным Google, до 4 раз быстрее авторегрессионных аналогов. На одной NVIDIA H100 модель выдаёт более 1000 токенов в секунду, а на потребительской RTX 5090 — более 700 токенов в секунду.

Можно ли запустить DiffusionGemma локально?

Да. При квантизации модель умещается примерно в 18 ГБ VRAM и запускается на топовых потребительских видеокартах, например RTX 5090, выдавая 700+ токенов в секунду. Веса открыты под Apache 2.0, что разрешает коммерческое использование и дообучение.

В чём недостаток DiffusionGemma?

Скорость куплена ценой точности: Google указывает, что DiffusionGemma остаётся ниже стандартной Gemma 4 на опубликованных бенчмарках. Модель выгодна там, где важна задержка — черновики, автодополнение, локальные ассистенты, — а в задачах с высокой ценой ошибки авторегрессионная Gemma 4 пока предпочтительнее.

По мотивам: Google: DiffusionGemma