AI News Watcher
Wednesday, Jul 22, 2026  ·  Daily briefing
Feed Telegram
Daily briefing · By AI News Watcher · Jul 22, 2026 · 2 min read · OpenRouter ← Back to feed

OpenRouter: голос в текст теперь через один API — и без отдельного сервиса daily

Платформа автоматически выбирает модель и провайдера по цене, не добавляя своих наценок.

OpenRouter: голос в текст теперь через один API — и без отдельного сервиса
Редакция · Daily briefing

Обычно, чтобы перевести голос в текст, инженерам приходится жонглировать несколькими SDK или разворачивать собственные Whisper-серверы. Теперь OpenRouter предлагает единый API, который делает это за один вызов — и с тем же ключом, что и для чата.

OpenRouter запустил новый API для транскрипции аудио, который использует тот же ключ и метод аутентификации, что и для чат-комплишенов. Это избавляет разработчиков от необходимости устанавливать отдельные SDK для преобразования речи в текст или разворачивать свои STT-серверы. Аудио отправляется в формате base64, а в ответ приходит JSON с текстовой расшифровкой и объектом использования.

Платформа автоматически балансирует нагрузку между моделями разных провайдеров. Если одна модель доступна у нескольких поставщиков, запросы распределяются между ними. Это исключает привязку к одному вендору и позволяет выбрать оптимальный вариант по цене. Для поиска доступных STT-моделей используется фильтр output_modalities=transcription. OpenRouter поддерживает два типа STT-моделей: Whisper-класса, которые тарифицируются за длительность аудио (посекундно), и новые токен-ориентированные STT-модели, тарифицируемые за количество токенов. Собственных наценок OpenRouter не добавляет, а фактическая стоимость каждого запроса указывается в поле usage.cost.

Для транскрипции аудио OpenRouter принимает данные двумя способами:

API позволяет передавать следующие параметры:

Основные ограничения, которые нужно учитывать:

Новый API OpenRouter снимает с инженеров задачу по выбору и управлению отдельными STT-провайдерами, унифицируя работу с голосом и текстом в рамках одной платформы. Это упрощает разработку мультимодальных приложений и позволяет точно отслеживать расходы. Однако, для очень длинных аудио или автоматического создания субтитров в форматах SRT/VTT, потребуется дополнительная ручная обработка.

Дополнительные источники

  1. https://openrouter.ai/pricing
  2. https://openrouter.ai/docs/guides/overview/multimodal/stt
  3. https://openrouter.ai/collections/speech-to-text-models
  4. https://openrouter.ai/blog/announcements/announcing-audio-apis
  5. https://aws.amazon.com/transcribe/pricing/
  6. costgoat.com
  7. openrouter.ai
  8. costgoat.com

Источники

  1. https://openrouter.ai/blog/tutorials/transcription-on-openrouter/ news
→ Опубликовано в Telegram: @agentic_ai_news/735