Голосовые интерфейсы часто спотыкаются о реальную речь с её запинками и междометиями. Google выпустил две новые модели Gemini 3.5 Transcribe и Gemini 3.5 Transcribe Live, которые превращают такую «сырую» речь в отформатированный и понятный текст.
Модели Gemini 3.5 Transcribe предлагают «умную транскрипцию», которая автоматически удаляет слова-паразиты («э-э-э», «ну»), исправляет самокоррекции говорящего («давайте встретимся во вторник — нет, в среду») и форматирует текст. Это упрощает последующую обработку и делает результат читаемым.
Новые модели ускорились: время до получения окончательной транскрипции сократилось на 70% по сравнению с предыдущей моделью Chirp 3. Точность также выросла: показатель WER (частота ошибок в словах) для нестриминговых сценариев составляет 2.6%, а для стриминговых — 4.0%. Эти данные приводит Artificial Analysis.
Помимо высокой точности и скорости, Gemini 3.5 Transcribe предлагает ряд возможностей:
- Обнаружение языка — поддерживает более 85 языков.
- Диаризация спикеров — определяет до трёх говорящих, с временными метками на уровне слов.
- Настраиваемый словарь — до 1000 терминов для распознавания специализированной лексики.
Версия Live обеспечивает двунаправленную потоковую транскрипцию с низкой задержкой через WebSockets, что критично для интерактивных голосовых приложений.
Модели также поддерживают вызов функций (function calling), позволяя делегировать сложные задачи другим моделям Gemini. Это даёт возможность создавать многофункциональные голосовые агенты, способные, например, генерировать изображения или анализировать файлы по голосовой команде.
Интеграция «умной» обработки речи с возможностью вызова функций других моделей Gemini открывает путь к созданию по-настоящему интеллектуальных голосовых помощников. Однако Google не раскрыл цены на новые модели, что является важным фактором для разработчиков.