Распознавать чистую речь — одна задача. Совсем другое — разобрать живой разговор с шумом, акцентами и несколькими голосами. xAI выпустила Grok Voice Transcribe 2.0, которая, по утверждению компании, вдвое точнее предыдущей версии в таких сложных условиях и не дороже.
xAI утверждает, что Grok Voice Transcribe 2.0 вдвое точнее своей предыдущей версии, Grok Voice Transcribe 1.0, при сохранении той же ценовой политики. Модель основана на базовой аудиомодели Grok Voice, которая уже обрабатывает десятки тысяч звонков в поддержку, миллионы часов видео и голосовых агентов в продуктах, включая помощник Grok в автомобилях Tesla.
Модель специально разработана для сложных реальных условий: зашумленные телефонные линии, несколько говорящих, местные акценты и чтение конфиденциальных данных. На публичном бенчмарке Artificial Analysis Grok Voice Transcribe 2.0 заняла первое место по точности среди 32 стриминговых моделей. По внутренним оценкам xAI, модель показала улучшение во всех категориях, включая телефонные звонки, диалоги с Grok, распознавание учетных данных и короткие многоязычные команды. Особенно заметен прогресс в многоязычном распознавании: модель поддерживает десятки языков, автоматически их определяет и справляется со сменой языка посреди записи. Например, в коротких фразах ошибок стало втрое меньше: WER снизился с 20.6% до 6.8%.
API Grok Voice Transcribe 2.0 предлагает расширенные возможности без необходимости менять код для существующих интеграций. Среди них:
- Пакетная и потоковая обработка — для записанных файлов, URL или аудиопотоков в реальном времени.
- Метки времени на уровне слов — точное время начала/конца и оценки достоверности каждого слова.
- Диаризация дикторов — автоматическая разметка каждого говорящего в стенограмме без дополнительной платы.
- Многоканальная транскрипция — до 8 независимых каналов.
- Приоритизация ключевых терминов — до 100 терминов на запрос (например, названия продуктов).
- Форматирование текста — числа, даты, валюты, номера телефонов и электронные адреса возвращаются в письменном виде.
- Удаление слов-паразитов — исключение из транскрипта таких слов, как «эм» и «а».
- Умное определение смены говорящего — полезно для голосовых агентов.
Пример реального применения — сервис Atlassian Loom, который использует Grok Voice Transcribe 2.0 для записи и обмена видео с экрана. Atlassian отметила, что новая модель точнее их предыдущего решения. Точные транскрипты позволяют создавать новые AI-воркфлоу: например, записать план действий в Loom, передать транскрипт в Cursor, который на его основе внесет изменения в код. По словам Санчана Саксены, старшего вице-президента Atlassian по коллекции Teamwork, это «замыкает цикл от контекста к коду: записываешь, что имеешь в виду, и работа делается».
Ценообразование для Grok Voice Transcribe 2.0 осталось прежним. Пакетная транскрипция стоит $0.10 за час аудио, потоковая — $0.20 за час. Диаризация, метки времени и приоритизация терминов включены в стоимость. В ближайшие недели Grok Voice Transcribe 2.0 станет моделью по умолчанию в Speech-to-Text API, а Grok Voice Transcribe 1.0 будет выведена из эксплуатации.
xAI явно нацелилась на самые сложные и критичные сценарии, где ошибки распознавания речи обходятся дорого. Улучшенная точность в шуме, с акцентами и на разных языках, при сохранении прежней цены, делает Grok Voice Transcribe 2.0 привлекательным обновлением для бизнеса, использующего голосовых агентов и автоматическую транскрипцию. Вопрос в том, насколько заявленные xAI улучшения подтвердятся в независимых тестах при массовом использовании.