AI News Watcher
Thursday, Sep 10, 2026  ·  Daily briefing
Feed Telegram
Daily briefing · By AI News Watcher · Sep 10, 2026 · 2 min read · Microsoft AI ← Back to feed

Microsoft Foundry: AI слушает, говорит и рисует одновременно daily

Модели OpenAI GPT-Live-1 и GPT-image-2.5 позволяют прерывать AI и менять запросы в реальном времени — это меняет подход к диалоговым интерфейсам.

Microsoft Foundry: AI слушает, говорит и рисует одновременно
Редакция · Daily briefing

Большинство AI-систем работают как рация: сказал — жди ответа. Теперь Microsoft Foundry предлагает модели OpenAI, которые меняют этот подход, позволяя AI слушать, говорить и генерировать изображения одновременно, как в живом диалоге. Это открывает путь к созданию по-настоящему интерактивных и отзывчивых мультимодальных приложений.

Microsoft Foundry теперь предоставляет доступ к моделям OpenAI GPT-Live-1 и GPT-image-2.5. GPT-Live-1 позволяет AI слушать и говорить одновременно (полнодуплексный режим), имитируя естественный диалог. А GPT-image-2.5 расширяет это взаимодействие, позволяя генерировать и редактировать изображения прямо во время разговора.

GPT-Live-1 имитирует естественный ритм человеческого общения, уходя от традиционной пошаговой логики "вопрос-ответ". Модель непрерывно оценивает, когда слушать, говорить, делать паузу или отвечать на прерывание. Среди ключевых возможностей:

Сочетание GPT-Live-1 с GPT-image-2.5 позволяет приложениям превращать идеи в визуальный контент по ходу обсуждения. Пользователю не нужно формулировать каждый запрос как отдельный промпт или начинать заново, если изменились требования. Вместо этого он может говорить естественно, видеть результат и сразу же реагировать. GPT-image-2.5, выпущенная 8 сентября 2026 года, обеспечивает более высокую скорость и низкую задержку по сравнению с предыдущими версиями, что критично для таких сценариев.

Внедрение этих моделей в Microsoft Foundry меняет подход к взаимодействию с AI: от последовательных команд к настоящей совместной работе. Для разработчиков это означает возможность создавать приложения, которые адаптируются к поведению пользователя, а не наоборот. Однако это также потребует переосмысления архитектуры и логики, чтобы использовать потенциал полнодуплексного и мультимодального взаимодействия.

Дополнительные источники

  1. What Is GPT Live 1? OpenAI's Full-Duplex Voice Model Explained
  2. GPT Image 2.5 Flare
  3. What is Microsoft Foundry?
  4. amazon.com

Источники

  1. https://techcommunity.microsoft.com/t5/microsoft-foundry-blog/create-multimodal-applications-with-openai-models-in-microsoft/ba-p/4543593 external
  2. https://techcommunity.microsoft.com/t5/microsoft-foundry-blog/voice-to-chat-best-practice-for-call-centre-use-cases/ba-p/4554634 external
→ Опубликовано в Telegram: @agentic_ai_news/1019