Що сталося
26 серпня 2026 року Google представила Gemini 3.5 Transcribe — окрему модель розпізнавання мовлення в родині Gemini. Вона вийшла у двох варіантах: gemini-3.5-transcribe для готових записів і gemini-3.5-transcribe-live для потокового розпізнавання в реальному часі. Модель сама визначає мову з-поміж 85+ підтримуваних, прибирає слова-паразити на кшталт «е-е» та «м-м» і враховує обмовки: якщо людина сказала «415, тобто 410», у тексті залишиться 410.
Розробникам модель доступна в публічному превʼю через Gemini API (Google AI Studio) та в Antigravity, компаніям — через Gemini Enterprise Agent Platform. Звичайним користувачам вона вже працює у Gboard на Android (функція Rambler) і в застосунку Gemini для macOS; голосове введення у Chrome обіцяють «незабаром».
Деталі
| Параметр | Gemini 3.5 Transcribe | Transcribe Live |
|---|---|---|
| Режим | готові записи | потік у реальному часі |
| Помилка розпізнавання (WER, Artificial Analysis) | 2,6% | 4,0% |
| WER на бенчмарку FLEURS | 5,04% | 5,50% |
| Ціна за 1 млн токенів (вхід аудіо / вихід текст) | $2 / $12 | $3,50 / $21 |
| Оцінка Google у хвилинах | близько $0,003 + $0,002 за хвилину | близько $0,005 + $0,004 за хвилину |
WER (word error rate) — частка неправильно розпізнаних слів; 2,6% означає приблизно одну помилку на 40 слів. За рейтингом Artificial Analysis на 26 серпня модель посіла пʼяте місце серед систем розпізнавання мовлення. Порівняно з попередньою моделлю Google Chirp 3 час до готової розшифровки скоротився на 70%.
Крім чищення мовлення модель підтримує власний словник для професійного жаргону, розмітку до трьох мовців (більше — в експериментальному режимі), часові позначки для кожного слова в записах і виклик функцій: розшифровка може передати завдання іншій моделі Gemini. Ціни наведено за сторінкою тарифів Gemini API на 26 серпня 2026 року; є безкоштовний рівень.
Що це означає
Стосується це насамперед розробників голосових агентів і сервісів диктування: за ціною виходить близько $0,30 за годину запису і близько $0,54 за годину потоку (за тарифами на 26 серпня), а затримку в потоці Artificial Analysis виміряла у 0,25–0,40 секунди після завершення фрази. Інтеграції в Agora, LiveKit, Pipecat і Vercel зʼявилися в день релізу, тож підключити модель до готового стеку можна без власного коду навколо Live API. Подкастерам і журналістам цікавіша версія для записів: розшифровка одразу приходить чистою, а не як сирий текст для ручного правлення.
Ризик — у самій «розумності». Модель за замовчуванням переписує мовлення начисто, а для судових, медичних та інтервʼю-протоколів потрібен дослівний запис — там обмовки й паузи самі по собі є інформацією. Перш ніж переводити такий потік на Gemini, варто перевірити, як модель поводиться на ваших записах, а не на демо. Тим, хто не хоче надсилати аудіо в хмару, і далі лишається локальний Whisper — він безкоштовний і працює офлайн, але без чищення мовлення та розмітки мовців.
Горизонт: API уже відкрито в превʼю, версія для Chrome зʼявиться пізніше без точної дати. Переліки підтримуваних мов і ліміти на тривалість аудіо краще звіряти з документацією Gemini API — в анонсі Google їх не розкриває.



