AI News Watcher
Wednesday, Aug 26, 2026  ·  Daily briefing
Feed Telegram
Daily briefing · By AI News Watcher · Aug 26, 2026 · 1 min read · Google ← Back to feed

Gemini 3.5 Transcribe: Google чистит «э-э-э» и форматирует речь в текст daily

Модели для живого и записанного аудио стали на 70% быстрее и точнее.

Gemini 3.5 Transcribe: Google чистит «э-э-э» и форматирует речь в текст
Редакция · Daily briefing

Голосовые интерфейсы часто спотыкаются о реальную речь с её запинками и междометиями. Google выпустил две новые модели Gemini 3.5 Transcribe и Gemini 3.5 Transcribe Live, которые превращают такую «сырую» речь в отформатированный и понятный текст.

Модели Gemini 3.5 Transcribe предлагают «умную транскрипцию», которая автоматически удаляет слова-паразиты («э-э-э», «ну»), исправляет самокоррекции говорящего («давайте встретимся во вторник — нет, в среду») и форматирует текст. Это упрощает последующую обработку и делает результат читаемым.

Новые модели ускорились: время до получения окончательной транскрипции сократилось на 70% по сравнению с предыдущей моделью Chirp 3. Точность также выросла: показатель WER (частота ошибок в словах) для нестриминговых сценариев составляет 2.6%, а для стриминговых — 4.0%. Эти данные приводит Artificial Analysis.

Помимо высокой точности и скорости, Gemini 3.5 Transcribe предлагает ряд возможностей:

Версия Live обеспечивает двунаправленную потоковую транскрипцию с низкой задержкой через WebSockets, что критично для интерактивных голосовых приложений.

Модели также поддерживают вызов функций (function calling), позволяя делегировать сложные задачи другим моделям Gemini. Это даёт возможность создавать многофункциональные голосовые агенты, способные, например, генерировать изображения или анализировать файлы по голосовой команде.

Интеграция «умной» обработки речи с возможностью вызова функций других моделей Gemini открывает путь к созданию по-настоящему интеллектуальных голосовых помощников. Однако Google не раскрыл цены на новые модели, что является важным фактором для разработчиков.

Дополнительные источники

  1. Audio transcription
  2. Live transcription with Gemini Live API
  3. Gemini 3.5 Transcribe
  4. Gemini Live API overview
  5. Gemini Enterprise for Customer Experience
  6. Rambler voice input on Gboard
  7. camb.ai
  8. blog.google

Источники

  1. https://ai.google.dev/gemini-api/docs/changelog#08-26-2026 docs
  2. https://deepmind.google/blog/intelligent-transcription-with-gemini-3-5-transcribe/ blog
→ Опубликовано в Telegram: @agentic_ai_news/920