Google DeepMind представила Gemini 3.5 Flash — новую версию линейки Flash. Модель стала заметно сильнее предшественника, но в тестах обходится гораздо дороже в работе.
По данным Artificial Analysis, получившей ранний доступ к модели, Gemini 3.5 Flash в среднем стоит в 5,5 раза дороже, чем Gemini 3 Flash, и почти вдвое дороже Gemini 3.1 Pro в бенчмарках. При этом контекстное окно осталось прежним — 1 млн токенов.
Google повысила цены на токены: $1,50 за 1 млн входных токенов и $9,00 за 1 млн выходных токенов против $0,50 и $3,00 у Gemini 3 Flash. Формально по цене за токен модель всё ещё дешевле Gemini 3.1 Pro, где тариф составляет $2,00 и $12,00 соответственно.
Однако на практике итоговая стоимость оказывается выше. По оценке Artificial Analysis, на агентных задачах Gemini 3.5 Flash расходует так много токенов, что общая цена выполнения оказывается на 75% выше, чем у Gemini 3.1 Pro.
Издание отмечает, что такой рост цен вписывается в общий тренд рынка. У Anthropic модель Opus 4.7 получила скрытое удорожание примерно на 30–40% по сравнению с прошлой версией из-за большего расхода токенов. У OpenAI GPT-5.5 подорожала примерно на 50–90% относительно 5.4: там расход токенов снизился, но выросли базовые тарифы. Google увеличила и тарифы, и расход токенов.
Для разработчиков и компаний цена за токен сама по себе становится менее показательной метрикой. Теперь важнее, сколько токенов модель реально тратит на выполнение задачи.
В индексе Artificial Analysis Intelligence Index модель набрала 55 баллов, что на девять пунктов выше результата Gemini 3 Flash. Это выше, чем у Grok 4.3 High с 53 баллами и Claude Sonnet 4.6 Max с 52. Рост заметен почти по всем проверяемым категориям, хотя бенчмарки по-прежнему отражают лишь часть реальных сценариев.
В тесте AA Omniscience, который измеряет точность знаний и склонность к галлюцинациям, Gemini 3.5 Flash прибавила 11 пунктов. Доля галлюцинаций снизилась до 61% против 92% у Gemini 3 Flash. Для сравнения, у лидеров MiMo-V2.5-Pro и Grok 4.3 High этот показатель составляет 25%.
Наибольший прогресс заметен в агентных сценариях, которые раньше были слабым местом Gemini. В тесте GDPval-AA, проверяющем реальные агентные задачи с доступом к вебу и shell, модель получила Elo-рейтинг 1656. Это значительно выше 1204 у Gemini 3 Flash и 1314 у Gemini 3.1 Pro и лишь немного ниже GPT-5.4 xhigh с 1674.
Высокий результат связан с большим числом шагов на задачу. В среднем Gemini 3.5 Flash делает 49 ходов на одно задание — это больше, чем у любой другой модели в тесте. Claude Opus 4.7 Max требуется 45 ходов, GPT-5.4 xhigh — 40, а Gemini 3.1 Pro — 23. Именно эти дополнительные шаги резко увеличивают расход входных токенов.
При этом расход выходных токенов почти не изменился: 73 млн против 72 млн у Gemini 3 Flash. Главный источник удорожания — входные токены, из-за чего общая цена Gemini 3.5 Flash обходит Gemini 3.1 Pro, несмотря на более низкую цену за токен.
В программировании новая модель выступила слабее. В Artificial Analysis Coding Index, который объединяет Terminal-Bench Hard и SciCode, Gemini 3.5 Flash набрала 45 баллов. Это ниже Gemini 3.1 Pro Preview с 55 баллами, GPT-5.5 xhigh с 59, GPT-5.4 xhigh с 57, Claude Opus 4.7 Max с 53 и Claude Sonnet 4.5 Max с 51.
На фоне высокого общего результата это заметный разрыв. Сильные стороны Gemini 3.5 Flash — агентные и мультимодальные задачи, но программирование остаётся одним из главных сценариев применения агентного ИИ, что ограничивает практическую ценность этого роста.
По данным Artificial Analysis, скорость генерации Gemini 3.5 Flash превышает 280 выходных токенов в секунду. Это примерно на 70% быстрее Gemini 3 Flash. Среди моделей с сопоставимым уровнем качества ни одна не показывает такую скорость вывода.
В отличие от многих конкурентов, модель также принимает видео и аудио наряду с текстом и изображениями. По данным Artificial Analysis, Claude Opus 4.7, Grok 4.3 и GPT-5.5 ограничены поддержкой изображений.
В мультимодальном бенчмарке MMMU-Pro Gemini 3.5 Flash набрала 84% — это лучший результат за всё время наблюдений Artificial Analysis. Второе место также у Google: Gemini 3.1 Pro получила 82%.
Рост цен отражает более широкий сдвиг на рынке. Современные ИИ-модели всё чаще рассчитаны на многошаговые задачи, где они сами строят план, используют инструменты и проходят через много раундов взаимодействия. Такой режим требует больше вычислений на каждую задачу, чем обычные чат-боты.
Если стоимость инференса на уровне оборудования не будет снижаться так же быстро, как растут вычисления на задачу, цены на более сильные модели продолжат расти. Для простых сценариев, как отмечает материал, по-прежнему будут востребованы более дешёвые старые модели и компактные варианты вроде Gemini 3.1 Flash-Lite.
Для бизнеса оценка отдачи от ИИ становится менее однозначной. Отдельные задачи, такие как генерация кода или перевод, ещё можно измерить по времени и затратам, но в интеллектуальной работе эффект размывается: его труднее отделить от других факторов, а выгода часто проявляется позже.
В материале The Decoder отмечается, что выбор более дорогих моделей становится ставкой на то, что рост эффективности окупит расходы и что работа с поддержкой ИИ станет стандартом. Источник: The Decoder, данные Artificial Analysis.






















