Google выпустила DiffusionGemma с открытыми весами

Google выпустила экспериментальную модель DiffusionGemma с открытыми весами, которая генерирует текст не по одному токену, а с помощью диффузионного подхода. По данным компании, в локальном режиме для одного пользователя она работает на выделенном GPU до четырех раз быстрее, чем классические языковые модели. Оптимизацией занималась Nvidia.

Обычные языковые модели создают текст последовательно, предсказывая каждый новый токен на основе предыдущих. DiffusionGemma начинает с блока из 256 случайных токенов-заполнителей и постепенно уточняет их за несколько проходов, пока не получается читаемый текст. Такой метод заимствован из генерации изображений, где диффузионные модели превращают шум в готовое изображение.

У модели 26 млрд параметров, но на каждом шаге используются только 3,8 млрд. Это возможно за счет архитектуры mixture-of-experts: модель состоит из нескольких специализированных подсетей и активирует только нужные в зависимости от входных данных. По данным Google, после квантизации до пониженной точности модель помещается в 18 ГБ видеопамяти на потребительских GPU верхнего класса. Она построена на семействе Gemma 4 и использует диффузионный процесс из более ранних исследований Google по Gemini Diffusion.

Nvidia объясняет прирост скорости особенностями загрузки железа. В авторегрессионных моделях инференс для одного пользователя часто упирается в пропускную способность памяти, из-за чего вычислительные блоки GPU простаивают в ожидании данных. DiffusionGemma обрабатывает до 256 токенов параллельно, поэтому нагрузка смещается в сторону вычислений, а GPU используется полнее.

По данным Nvidia, модель показывает около 1000 токенов в секунду на H100 при обработке одного запроса, 150 токенов в секунду на системе DGX Spark и до 800 токенов в секунду на DGX Station. На GeForce RTX 5090, по данным Google, скорость превышает 700 токенов в секунду. В локальном режиме для одного пользователя модель примерно в четыре раза быстрее сопоставимой авторегрессионной модели на выделенных GPU.

Google связывает этот эффект прежде всего с выделенными ускорителями. На системах с общей памятью, таких как Apple Silicon, где инференс также часто ограничен пропускной способностью памяти, разрыв с авторегрессионными моделями, вероятно, будет меньше.

При облачном обслуживании с большим числом параллельных запросов преимущество может исчезать. Google отмечает, что в таком режиме авторегрессионные модели и так хорошо загружают оборудование, поэтому DiffusionGemma может даже повысить стоимость работы.

Модель делает ставку на скорость, а не на максимум качества. Google по-прежнему рекомендует обычные модели Gemma 4, если в приоритете качество ответа, а DiffusionGemma позиционирует как инструмент для исследователей и разработчиков, которым нужны быстрые локальные сценарии.

Google считает сильной стороной модели задачи, которые плохо решаются слева направо. Поскольку DiffusionGemma рассматривает сразу весь блок токенов, каждый токен может учитывать все остальные, включая те, что стоят позже. Традиционные языковые модели умеют смотреть только назад.

Это делает модель полезной для вставки текста в готовые абзацы, заполнения пропусков в коде и работы со структурированными данными, например с аминокислотными последовательностями и математическими графами. В качестве примера Google приводит fine-tune от Unsloth, где DiffusionGemma решает судоку. Авторегрессионные модели обычно справляются с такой задачей хуже, так как каждое значение зависит от последующих.

Веса модели опубликованы на Hugging Face по лицензии Apache 2.0. DiffusionGemma поддерживается популярными библиотеками инференса, включая Hugging Face Transformers, vLLM с поддержкой интеграции Red Hat и MLX. Для дообучения Google указывает собственный JAX-инструментарий Hackable Diffusion, а также Unsloth и Nvidia NeMo Framework. Поддержка llama.cpp запланирована.

Nvidia подготовила квантизированные версии модели для RTX 5090 и RTX 4090, а также оптимизировала ее для серверных архитектур Hopper и Blackwell, включая DGX Spark и DGX Station для локальных настольных систем. Модель также доступна через Gemini Enterprise Agent Platform Model Garden и Nvidia NIM.

Google также выпустила руководство для разработчиков по DiffusionGemma, а Маартен Гротендорст опубликовал визуальный гид с объяснением принципов работы модели.

Ранее Google DeepMind уже показывала раннюю экспериментальную демонстрацию текстовой диффузионной модели Gemini Diffusion. Тогда компания заявляла скорость 1479 токенов в секунду. В бенчмарках Gemini Diffusion показывала результат примерно на уровне Gemini 2.0 Flash-Lite.

Похожий параллельный диффузионный подход развивает стартап Inception. Его модель Mercury 2 вышла в начале 2026 года и, по заявлению компании, стала первой reasoning-моделью на базе диффузии.

Источник: The Decoder, Google, Nvidia.

Читать новости ИИ и технологий в Telegram.


Оцените статью
Gimal-Ai