Чтобы робот действовал автономно, он должен не просто видеть, но и понимать, как меняется мир вокруг, что может произойти и как его действия повлияют на сцену. Обычно такие сложные рассуждения требуют мощностей облака, но NVIDIA выпустила Cosmos 3 Edge — открытую модель мира, которая переносит эти возможности прямо на периферийные устройства.
Cosmos 3 Edge — это 4-миллиардная открытая модель, предназначенная для работы на периферийных устройствах. Она позволяет роботам и ИИ-агентам понимать своё окружение, рассуждать в реальном времени и генерировать действия прямо на устройстве. В реальном мире физическим ИИ-системам (роботам, автономным машинам) нужно не просто распознавать объекты, но и предвидеть изменения, понимать последствия своих действий. Такие системы часто работают в условиях ограниченной памяти, например, на заводах, складах или в больницах, где требуется производительность уровня дата-центра.
Модель обеспечивает эффективное использование памяти и высокую пропускную способность. Она работает на различных периферийных устройствах NVIDIA, включая RTX PRO, GeForce RTX, а также модули Jetson (в том числе новые T2000 и T3000). Cosmos 3 Edge оптимизирована как компактная визуально-языковая модель (VLM) с лучшими в своём классе показателями пропускной способности и точности для вывода в реальном времени.
Как модель мировых действий (WAM), Cosmos 3 Edge обрабатывает наблюдения в разрешении 640×360, выполняя рассуждения в реальном времени и генерируя до 32 действий за один вывод на NVIDIA Jetson Thor, при этом достигая частоты управления в 15 Гц. Среди моделей аналогичного размера (4 млрд параметров) Cosmos 3 Edge занимает первое место в бенчмарке VANTAGE-Bench для визуальной аналитики и демонстрирует результаты в обучении политики роботов.
Модель мира учится тому, как окружение меняется со временем. Она представляет объекты, их движение, пространственные отношения и последствия действий. Например, чтобы взять предмет, роботу нужно не только распознать его, но и понять его положение, движение захвата, возможные исходы контакта и наиболее эффективное действие. Cosmos 3 Edge объединяет эти функции в единой модели, работающей на устройстве, позволяя физическим ИИ-системам понимать текущее состояние мира, симулировать будущие сценарии и связывать их с действиями.
Архитектура Cosmos 3 Edge включает две трансформерные башни с общим представлением: авторегрессивная башня обрабатывает визуальные и текстовые токены для понимания и рассуждения, а диффузионная башня — визуальные, аудио- и экшн-токены для предсказания, генерации и нейронной симуляции. Обе башни используют общие многомодальные слои внимания, которые выравнивают информацию по языку, видео, аудио и действиям. Это позволяет модели рассуждать о сцене перед генерацией вывода. В зависимости от задачи Cosmos 3 может выдавать токены рассуждения или очищенные видео- и экшн-токены.
Cosmos 3 Edge демонстрирует, что сложные возможности ИИ-рассуждений и генерации действий теперь могут работать непосредственно на роботах и периферийных устройствах. Это критически важный шаг для создания по-настоящему автономных физических ИИ-систем, способных действовать в реальном мире без постоянной связи с облаком. Открытый доступ к модели на Hugging Face позволяет инженерам начать её внедрение уже сейчас.