Google випустила Gemini 3.6 Flash — агенти стали економічнішими за токенами

4 хв. читання

Що сталося

21 липня 2026 року Google і DeepMind випустили Gemini 3.6 Flash — оновлення флагманської «швидкої» моделі лінійки Gemini, націлене насамперед на ШІ-агентів, які роблять багато кроків поспіль (пишуть код, викликають інструменти, перевіряють результат і повторюють цикл). Ціна: $1,50 за 1 млн вхідних токенів і $7,50 за 1 млн вихідних — порівняно з попередньою версією Gemini 3.5 Flash вихідну ціну знижено з $9. Разом із нею вийшли ще дві моделі того самого сімейства: Gemini 3.5 Flash-Lite і Gemini 3.5 Flash Cyber.

Деталі

  • Менше токенів на відповідь. За незалежним індексом Artificial Analysis, Gemini 3.6 Flash витрачає на 17% менше вихідних токенів, ніж Gemini 3.5 Flash, за порівнянної якості відповіді.
  • До 65% — але на конкретному бенчмарку. На тесті DeepSWE (агентні інженерні завдання: правка коду в кілька кроків) Google заявляє скорочення вихідних токенів до 65% — за рахунок того, що модель робить менше кроків міркування і рідше смикає зовнішні інструменти на одне завдання. Це цифра по одному бенчмарку довгих агентних прогонів, а не універсальний показник для будь-якого навантаження.
  • Gemini 3.5 Flash-Lite — модель для високого обсягу запитів: швидкість близько 350 токенів за секунду, ціна $0,30 за 1 млн вхідних і $2,50 за 1 млн вихідних токенів.
  • Gemini 3.5 Flash Cyber — версія, донавчена на пошук і усунення вразливостей у коді (бенчмарк CyberGym); доступ обмежений пілотом для державних організацій і перевірених партнерів через програму CodeMender.
  • Gemini 3.5 Pro поки не вийшла: модель анонсували на конференції Google I/O 19 травня 2026 року, наразі вона в закритому тестуванні з партнерами, дата публічного релізу не названа.

Що це означає

Стосується насамперед розробників і команд, які ганяють ШІ-агентів на довгих завданнях — тобто аудиторії, яка вже працює з інструментами на кшталт Claude Code або Codex і закладає бюджет на токени як реальну статтю витрат (там та сама механіка: що більше кроків і викликів інструментів на завдання, то швидше впираєшся в ліміт або в рахунок). Якщо ваш агент робить багато кроків на одне завдання (розбір бага, рефакторинг, багатокроковий агентний пайплайн), зниження ціни вихідних токенів з $9 до $7,50 за 1 млн плюс менша кількість токенів на той самий результат складаються в помітну економію саме на довгих прогонах — але не факт, що на коротких запитах ефект буде таким самим: заявлені 65% виміряні на одному бенчмарку інженерних завдань, а не на всьому підряд, і це варто перевіряти на своїх сценаріях, а не переносити цифру автоматично. Горизонт — одразу: Gemini 3.6 Flash і Flash-Lite вже доступні через API Google AI Studio, спробувати й порівняти зі своїм поточним агентом можна вже сьогодні. Тим, хто обирає не лише модель, а й API для інструментів агента (пошук, скрапінг), та сама логіка бюджету застосовна до підбору web search API для ШІ-агентів — ціна за виклик там визначається за тим самим принципом «токени/запити на завдання».

Поділитися
Зв'язатися:
Крипто- та data-аналітик, інженер-програміст (факультет комп'ютерних наук ХНУРЕ). В IT з 2008 року: адміністрував корпоративний моніторинг у «Vodafone Україна», сім років розробляв і просував веб-проєкти, п'ять років керував маркетингом на метриках — конверсія, CTR, ROI, LTV.Криптовалютними ринками займаюся з 2021 року: ончейн-метрики, токеноміка, макроекономічні індикатори. Розробив власну data-driven модель аналізу ринку на 30+ метрик. Стек — Python (pandas, NumPy, SciPy, matplotlib), математична статистика та EDA; збір і звірку даних автоматизую AI-агентами.Принцип — «Don't trust, verify»: кожна цифра перевірена за першоджерелом, ключові — щонайменше за двома незалежними; прогнози — лише сценарії з умовами. Теза без даних не публікується.