Gemini 3.5 Transcribe: 85+ языков, WER 2,6% и около $0,30 за час аудио в API

4 мин. чтения
Bybit
$30,100 + $5,030
100 USDT в подарок
Получить →

Что произошло

26 августа 2026 года Google представила Gemini 3.5 Transcribe — отдельную модель распознавания речи в семействе Gemini. Она вышла в двух вариантах: gemini-3.5-transcribe для готовых записей и gemini-3.5-transcribe-live для потокового распознавания в реальном времени. Модель сама определяет язык из 85+ поддерживаемых, убирает слова-паразиты вроде «э-э» и «м-м» и учитывает оговорки: если человек сказал «415, то есть 410», в тексте останется 410.

Для разработчиков модель доступна в публичном превью через Gemini API (Google AI Studio) и в Antigravity, для компаний — через Gemini Enterprise Agent Platform. Обычным пользователям она уже работает в Gboard на Android (функция Rambler) и в приложении Gemini для macOS; голосовой ввод в Chrome обещан «скоро».

Детали

ПараметрGemini 3.5 TranscribeTranscribe Live
Режимготовые записипоток в реальном времени
Ошибка распознавания (WER, Artificial Analysis)2,6%4,0%
WER на бенчмарке FLEURS5,04%5,50%
Цена за 1 млн токенов (вход аудио / выход текст)$2 / $12$3,50 / $21
Оценка Google в минутахоколо $0,003 + $0,002 за минутуоколо $0,005 + $0,004 за минуту

WER (word error rate) — доля неверно распознанных слов; 2,6% означает примерно одну ошибку на 40 слов. По рейтингу Artificial Analysis на 26 августа модель заняла пятое место среди систем распознавания речи. По сравнению с прежней моделью Google Chirp 3 время до готовой расшифровки сократилось на 70%.

Помимо чистки речи модель поддерживает пользовательский словарь для профессионального жаргона, разметку до трёх говорящих (больше — в экспериментальном режиме), пометки времени для каждого слова в записях и вызов функций: расшифровка может передать задачу другой модели Gemini. Цены указаны по странице тарифов Gemini API на 26 августа 2026 года; есть бесплатный уровень.

Что это значит

Касается это прежде всего разработчиков голосовых агентов и сервисов диктовки: по цене выходит около $0,30 за час записи и около $0,54 за час потока (по тарифам на 26 августа), а латентность в потоке Artificial Analysis измерила в 0,25–0,40 секунды после конца фразы. Интеграции у Agora, LiveKit, Pipecat и Vercel появились в день релиза, так что подключить модель в готовый стек можно без своего кода вокруг Live API. Подкастерам и журналистам интереснее версия для записей: расшифровка сразу приходит без мусора, а не как сырой текст для ручной правки.

Риск в самой «умности». Модель по умолчанию переписывает речь начисто, а для судебных, медицинских и интервью-протоколов нужна дословная запись — там оговорки и паузы сами по себе информация. Прежде чем переводить такой поток на Gemini, стоит проверить, как модель ведёт себя на ваших записях, а не на демо. Тем, кто не хочет отправлять аудио в облако, по-прежнему остаётся локальный Whisper — он бесплатный и работает офлайн, но без чистки речи и разметки говорящих.

Горизонт: API уже открыт в превью, версия для Chrome появится позже без точной даты. Списки поддерживаемых языков и лимиты на длину аудио лучше сверять с документацией Gemini API — в анонсе Google их не раскрывает.

Bybit
$30,100 + $5,030
100 USDT в подарок
Получить →
Поделиться
Связаться:
Крипто- и data-аналитик, инженер-программист (факультет компьютерных наук ХНУРЭ). В IT с 2008 года: администрировал корпоративный мониторинг в «Vodafone Украина», семь лет разрабатывал и продвигал веб-проекты, пять лет руководил маркетингом на метриках — конверсия, CTR, ROI, LTV.Криптовалютными рынками занимаюсь с 2021 года: ончейн-метрики, токеномика, макроэкономические индикаторы. Разработал собственную data-driven модель анализа рынка на 30+ метрик. Стек — Python (pandas, NumPy, SciPy, matplotlib), математическая статистика и EDA; сбор и сверку данных автоматизирую AI-агентами.Принцип — «Don't trust, verify»: каждая цифра проверена по первоисточнику, ключевые — минимум по двум независимым; прогнозы — только сценарии с условиями. Тезис без данных не публикуется.