Что произошло
21 июля 2026 года Google и DeepMind выпустили Gemini 3.6 Flash — обновление флагманской «быстрой» модели линейки Gemini, нацеленное прежде всего на ИИ-агентов, которые совершают много шагов подряд (пишут код, вызывают инструменты, проверяют результат и повторяют). Цена: $1,50 за 1 млн входных токенов и $7,50 за 1 млн выходных — по сравнению с прошлой версией Gemini 3.5 Flash выходная цена снижена с $9. Вместе с ней вышли ещё две модели того же семейства: Gemini 3.5 Flash-Lite и Gemini 3.5 Flash Cyber.
Детали
- Меньше токенов на ответ. По независимому индексу Artificial Analysis, Gemini 3.6 Flash тратит на 17% меньше выходных токенов, чем Gemini 3.5 Flash, при сопоставимом качестве ответа.
- До 65% — но на конкретном бенчмарке. На тесте DeepSWE (агентные инженерные задачи: правка кода в несколько шагов) Google заявляет сокращение выходных токенов до 65% — за счёт того, что модель делает меньше шагов рассуждения и реже дёргает внешние инструменты на одну задачу. Это цифра по одному бенчмарку длинных агентных прогонов, а не универсальный показатель для любой нагрузки.
- Gemini 3.5 Flash-Lite — модель для высокого объёма запросов: скорость около 350 токенов в секунду, цена $0,30 за 1 млн входных и $2,50 за 1 млн выходных токенов.
- Gemini 3.5 Flash Cyber — версия, дообученная на поиск и устранение уязвимостей в коде (бенчмарк CyberGym); доступ ограничен пилотом для государственных организаций и проверенных партнёров через программу CodeMender.
- Gemini 3.5 Pro пока не вышла: модель анонсировали на конференции Google I/O 19 мая 2026 года, сейчас она в закрытом тестировании с партнёрами, дата публичного релиза не названа.
Что это значит
Касается прежде всего разработчиков и команд, которые гоняют ИИ-агентов на длинных задачах — то есть аудитории, которая уже работает с инструментами вроде Claude Code или Codex и считает бюджет на токены как реальную статью расходов (там та же механика: чем больше шагов и вызовов инструментов на задачу, тем быстрее упираешься в лимит или в счёт). Если ваш агент делает много шагов на одну задачу (разбор бага, рефакторинг, многошаговый агентный пайплайн), снижение цены выходных токенов с $9 до $7,50 за 1 млн плюс меньшее число токенов на тот же результат складываются в заметную экономию именно на длинных прогонах — но не факт, что на коротких запросах эффект будет таким же: заявленные 65% измерены на одном бенчмарке инженерных задач, а не на всём подряд, и это стоит проверять на своих сценариях, а не переносить цифру автоматически. Горизонт — сразу: Gemini 3.6 Flash и Flash-Lite уже доступны через API Google AI Studio, попробовать и сравнить со своим текущим агентом можно сегодня же. Тем, кто выбирает не только модель, но и API для инструментов агента (поиск, скрапинг), эта же логика бюджета применима к подбору web search API для AI-агентов — цена за вызов там считается по тому же принципу «токены/запросы на задачу».


