Роботы, способные адаптироваться к непредсказуемой среде и учиться на ходу, до сих пор были скорее мечтой. Теперь ElevenLabs открывает разработчикам доступ к модели Gemini Robotics ER 2 от Google DeepMind, которая позволяет машинам воспринимать мир, рассуждать и управлять своим телом как единым целым.
Gemini Robotics ER 2 — это модель «зрение-язык-действие» (VLA) от Google DeepMind. Она позволяет роботам не только понимать окружающий мир, но и планировать сложные многошаговые задачи, а также управлять своим телом как единым целым. Модель обеспечивает тонкую моторику и даже совместную работу с другими роботами. При этом она способна работать локально на устройстве и адаптироваться к новым типам роботов всего за несколько часов.
ElevenLabs предоставляет разработчикам доступ к этой технологии через свой Live API. Используется версия Gemini Robotics ER 2 Streaming, которая специально оптимизирована для обработки непрерывных аудио- и видеопотоков с минимальной задержкой. Это даёт возможность создавать роботов-агентов, способных к мгновенному и естественному взаимодействию с окружающей средой.
Этот шаг является частью углубления стратегического сотрудничества ElevenLabs с Google Cloud. Ранее ElevenLabs уже использовала инфраструктуру Google для своих голосовых моделей. Теперь партнёрство расширяется на сферу робототехники, предлагая разработчикам более простой и быстрый путь к внедрению сложного мультимодального ИИ в свои роботизированные решения.
Доступность Gemini Robotics ER 2 через Live API от ElevenLabs упрощает внедрение ИИ в робототехнику, позволяя инженерам сосредоточиться на создании приложений, а не на инфраструктуре. Однако ElevenLabs пока не раскрыла конкретных примеров использования этой интеграции или подробностей о ценовой политике.