Что произошло
26 августа 2026 года Google представила Gemini 3.5 Transcribe — отдельную модель распознавания речи в семействе Gemini. Она вышла в двух вариантах: gemini-3.5-transcribe для готовых записей и gemini-3.5-transcribe-live для потокового распознавания в реальном времени. Модель сама определяет язык из 85+ поддерживаемых, убирает слова-паразиты вроде «э-э» и «м-м» и учитывает оговорки: если человек сказал «415, то есть 410», в тексте останется 410.
Для разработчиков модель доступна в публичном превью через Gemini API (Google AI Studio) и в Antigravity, для компаний — через Gemini Enterprise Agent Platform. Обычным пользователям она уже работает в Gboard на Android (функция Rambler) и в приложении Gemini для macOS; голосовой ввод в Chrome обещан «скоро».
Детали
| Параметр | Gemini 3.5 Transcribe | Transcribe Live |
|---|---|---|
| Режим | готовые записи | поток в реальном времени |
| Ошибка распознавания (WER, Artificial Analysis) | 2,6% | 4,0% |
| WER на бенчмарке FLEURS | 5,04% | 5,50% |
| Цена за 1 млн токенов (вход аудио / выход текст) | $2 / $12 | $3,50 / $21 |
| Оценка Google в минутах | около $0,003 + $0,002 за минуту | около $0,005 + $0,004 за минуту |
WER (word error rate) — доля неверно распознанных слов; 2,6% означает примерно одну ошибку на 40 слов. По рейтингу Artificial Analysis на 26 августа модель заняла пятое место среди систем распознавания речи. По сравнению с прежней моделью Google Chirp 3 время до готовой расшифровки сократилось на 70%.
Помимо чистки речи модель поддерживает пользовательский словарь для профессионального жаргона, разметку до трёх говорящих (больше — в экспериментальном режиме), пометки времени для каждого слова в записях и вызов функций: расшифровка может передать задачу другой модели Gemini. Цены указаны по странице тарифов Gemini API на 26 августа 2026 года; есть бесплатный уровень.
Что это значит
Касается это прежде всего разработчиков голосовых агентов и сервисов диктовки: по цене выходит около $0,30 за час записи и около $0,54 за час потока (по тарифам на 26 августа), а латентность в потоке Artificial Analysis измерила в 0,25–0,40 секунды после конца фразы. Интеграции у Agora, LiveKit, Pipecat и Vercel появились в день релиза, так что подключить модель в готовый стек можно без своего кода вокруг Live API. Подкастерам и журналистам интереснее версия для записей: расшифровка сразу приходит без мусора, а не как сырой текст для ручной правки.
Риск в самой «умности». Модель по умолчанию переписывает речь начисто, а для судебных, медицинских и интервью-протоколов нужна дословная запись — там оговорки и паузы сами по себе информация. Прежде чем переводить такой поток на Gemini, стоит проверить, как модель ведёт себя на ваших записях, а не на демо. Тем, кто не хочет отправлять аудио в облако, по-прежнему остаётся локальный Whisper — он бесплатный и работает офлайн, но без чистки речи и разметки говорящих.
Горизонт: API уже открыт в превью, версия для Chrome появится позже без точной даты. Списки поддерживаемых языков и лимиты на длину аудио лучше сверять с документацией Gemini API — в анонсе Google их не раскрывает.


