Голосовые ИИ часто грешат неестественными паузами, обрывают мысль или выдают устаревшие ответы. OpenAI заявляет, что решила эти проблемы с GPT-Live — новой системой, которая обещает непрерывное и интеллектуальное голосовое взаимодействие, больше похожее на разговор с человеком.
GPT-Live создавалась шесть месяцев, чтобы обеспечить по-настоящему непрерывное голосовое взаимодействие. В её основе лежит модель речи без пауз и архитектура с низкой задержкой, что позволяет вести более быстрые и естественные диалоги.
Ключевая особенность, отмеченная первыми тестерами, — это способность системы делегировать вопросы более моделям, например, GPT-5.5, в фоновом режиме. Это означает, что пользователь не ограничен возможностями базовой голосовой модели и может получать актуальные и сложные ответы. Тестеры отмечали, что могли вести часовые диалоги, например, для мозгового штурма во время прогулки.
Разработчики также учли обратную связь по предыдущим версиям: был исправлен баг, из-за которого ИИ прерывал пользователя и даже смеялся над его шутками. Сообщество выражает запрос на "утилитарный" ИИ, похожий на компьютер из Star Trek, а не на "друга" или "AI-girlfriend", как иногда звучали прошлые попытки.
В отличие от OpenAI Whisper, которая является открытой моделью для распознавания речи, GPT-Live нацелена на полноценный двусторонний диалог, включая генерацию речи. Конкуренты, такие как Google Gemini Live API, также развивают мультимодальное взаимодействие в реальном времени, используя WebSockets для обмена текстом и аудио.
GPT-Live демонстрирует, что непрерывный и интеллектуальный голосовой ИИ — это уже реальность, а не только маркетинговое обещание. Однако, судя по реакции первых пользователей, OpenAI предстоит тоньше настроить "личность" своего ИИ, чтобы он оставался полезным инструментом, а не превращался в нежелательного "друга".