Google DeepMind 10 июня 2026 года выложила в открытый доступ DiffusionGemma — экспериментальную языковую модель, которая генерирует текст не последовательно, а блоками через механизм диффузии. По данным Google, модель выдаёт блок из 256 токенов параллельно за один проход вперёд и работает до 4 раз быстрее авторегрессионных аналогов. Веса распространяются под лицензией Apache 2.0, что разрешает коммерческое использование и дообучение.
Ключевые факты
- Google DeepMind открыла DiffusionGemma 10 июня 2026 года под лицензией Apache 2.0 — первую открытую LLM на текстовой диффузии.
- Модель — MoE на 26 млрд параметров с ~3,8 млрд активных; генерирует блок из 256 токенов параллельно за один проход вперёд, где каждый токен видит все остальные.
- Скорость генерации до 4 раз выше авторегрессии: 1000+ токенов/с на одной NVIDIA H100 и 700+ токенов/с на потребительской RTX 5090.
- При квантизации модель умещается в ~18 ГБ VRAM и запускается на топовых потребительских видеокартах.
- Компромисс заявлен явно: DiffusionGemma остаётся ниже стандартной Gemma 4 на опубликованных бенчмарках, обменивая точность на скорость.
Что такое текстовая диффузия и чем она отличается от авторегрессии
Классическая LLM генерирует текст по одному токену: каждый следующий зависит от уже написанных, и проходов вперёд требуется столько же, сколько токенов в ответе. DiffusionGemma устроена иначе. По описанию DeepMind, модель берёт блок из 256 токенов и за один проход уточняет его целиком — каждый токен в блоке видит все остальные, а не только предшествующие. Подход перенесён из генерации изображений, где диффузионные модели восстанавливают картинку из шума за несколько шагов.
Практическое следствие — параллелизм. Авторегрессия упирается в длину ответа: 1000 токенов означают 1000 последовательных проходов. Диффузия обрабатывает блок за фиксированное число шагов независимо от того, сколько токенов в нём, и именно отсюда берётся прирост скорости. MarkTechPost описывает DiffusionGemma как первую открытую модель такого класса — раньше текстовая диффузия оставалась внутри исследовательских лабораторий и закрытых демо.
Архитектура и производительность
DiffusionGemma — это Mixture-of-Experts на 26 млрд параметров с примерно 3,8 млрд активных на запрос. Малое число активных параметров удерживает требования к памяти на уровне, доступном вне дата-центра.
- Параметры: 26 млрд всего, ~3,8 млрд активных (MoE)
- Размер блока генерации: 256 токенов за проход
- Скорость на сервере: 1000+ токенов/с на одной NVIDIA H100
- Скорость локально: 700+ токенов/с на RTX 5090
- Память: умещается в ~18 ГБ VRAM при квантизации
- Лицензия: Apache 2.0
Цифры NVIDIA важны отдельно: 700+ токенов в секунду на потребительской RTX 5090 и порог в ~18 ГБ VRAM означают, что модель запускается на топовых игровых видеокартах, а не только на серверных ускорителях. Для локального инференса это редкое сочетание скорости и доступного железа.
Выигрыш в скорости нелинеен по длине ответа. На коротких репликах разница с авторегрессией невелика — там и так мало проходов. Но чем длиннее генерация, тем сильнее расходятся кривые: авторегрессия платит за каждый новый токен отдельным проходом, а диффузия обрабатывает блоки фиксированного размера. Поэтому максимальную отдачу модель даёт на длинных выводах — генерации кода, документов, потоковых ответах, — где задержка авторегрессии накапливается быстрее всего.
Двунаправленность блока даёт и побочное свойство. Модель видит контекст с обеих сторон и может заполнять пропуски внутри блока, а не только продолжать текст слева направо. Для авторегрессии вставка в середину — неудобный сценарий; диффузия обрабатывает его естественно, что полезно при дополнении и правке кода.
Скорость в обмен на качество
Главный компромисс заявлен самой Google: DiffusionGemma остаётся ниже стандартной Gemma 4 на опубликованных бенчмарках. Скорость куплена ценой точности, и для задач, где важна максимальная аккуратность ответа, авторегрессионная Gemma 4 пока предпочтительнее.
Расстановка понятна, если смотреть на сценарии. Параллельная генерация выигрывает там, где критична задержка, а не последний процент качества: черновики, автодополнение, потоковые ответы, локальные ассистенты на одной видеокарте. Авторегрессия удерживает преимущество в задачах, где ошибка дорого стоит. По сути DeepMind предлагает не замену Gemma 4, а второй режим — для тех, кто готов обменять точность на пропускную способность. Тот же прагматизм двигал недавние открытые релизы: открытые веса GLM-5.2 и семейство Qwen3 делали ставку на стоимость и эффективность эксплуатации, а не на верхнюю строку лидерборда.
Открытость под Apache 2.0 здесь принципиальна. Текстовая диффузия до сих пор существовала в основном как академическая тема, и доступ к рабочим весам позволяет сообществу проверить, насколько разрыв с авторегрессией сокращается при дообучении. Если следующие итерации подтянут качество ближе к Gemma 4 при сохранении скорости, диффузия из эксперимента превратится в практичную альтернативу для латентно-чувствительных сценариев. Свежие релизы открытых моделей собраны в категории «Модели».
Частые вопросы
Что такое DiffusionGemma и кто её выпустил?
DiffusionGemma — экспериментальная открытая языковая модель Google DeepMind, выпущенная 10 июня 2026 года под лицензией Apache 2.0. Это первая открытая LLM на текстовой диффузии: MoE на 26 млрд параметров с ~3,8 млрд активных, которая генерирует текст блоками по 256 токенов вместо последовательной генерации по одному токену.
Чем текстовая диффузия отличается от авторегрессии?
Авторегрессионная LLM пишет текст по одному токену, и проходов вперёд нужно столько же, сколько токенов в ответе. DiffusionGemma за один проход уточняет целый блок из 256 токенов, где каждый токен видит все остальные. Подход перенесён из генерации изображений и даёт прирост скорости за счёт параллелизма.
Насколько DiffusionGemma быстрее обычных моделей?
По данным Google, до 4 раз быстрее авторегрессионных аналогов. На одной NVIDIA H100 модель выдаёт более 1000 токенов в секунду, а на потребительской RTX 5090 — более 700 токенов в секунду.
Можно ли запустить DiffusionGemma локально?
Да. При квантизации модель умещается примерно в 18 ГБ VRAM и запускается на топовых потребительских видеокартах, например RTX 5090, выдавая 700+ токенов в секунду. Веса открыты под Apache 2.0, что разрешает коммерческое использование и дообучение.
В чём недостаток DiffusionGemma?
Скорость куплена ценой точности: Google указывает, что DiffusionGemma остаётся ниже стандартной Gemma 4 на опубликованных бенчмарках. Модель выгодна там, где важна задержка — черновики, автодополнение, локальные ассистенты, — а в задачах с высокой ценой ошибки авторегрессионная Gemma 4 пока предпочтительнее.