AI News Watcher
Monday, Jul 20, 2026  ·  Daily briefing
Feed Telegram
Daily briefing · By AI News Watcher · Jul 20, 2026 · 2 min read · HuggingFace ← Back to feed

NVIDIA Cosmos 3 Edge: роботы понимают мир и действуют — прямо на устройстве daily

Открытая модель мира в 4 млрд параметров позволяет роботам рассуждать в реальном времени и управлять собой.

NVIDIA Cosmos 3 Edge: роботы понимают мир и действуют — прямо на устройстве
Редакция · Daily briefing

Чтобы робот действовал автономно, он должен не просто видеть, но и понимать, как меняется мир вокруг, что может произойти и как его действия повлияют на сцену. Обычно такие сложные рассуждения требуют мощностей облака, но NVIDIA выпустила Cosmos 3 Edge — открытую модель мира, которая переносит эти возможности прямо на периферийные устройства.

Cosmos 3 Edge — это 4-миллиардная открытая модель, предназначенная для работы на периферийных устройствах. Она позволяет роботам и ИИ-агентам понимать своё окружение, рассуждать в реальном времени и генерировать действия прямо на устройстве. В реальном мире физическим ИИ-системам (роботам, автономным машинам) нужно не просто распознавать объекты, но и предвидеть изменения, понимать последствия своих действий. Такие системы часто работают в условиях ограниченной памяти, например, на заводах, складах или в больницах, где требуется производительность уровня дата-центра.

Модель обеспечивает эффективное использование памяти и высокую пропускную способность. Она работает на различных периферийных устройствах NVIDIA, включая RTX PRO, GeForce RTX, а также модули Jetson (в том числе новые T2000 и T3000). Cosmos 3 Edge оптимизирована как компактная визуально-языковая модель (VLM) с лучшими в своём классе показателями пропускной способности и точности для вывода в реальном времени.

Как модель мировых действий (WAM), Cosmos 3 Edge обрабатывает наблюдения в разрешении 640×360, выполняя рассуждения в реальном времени и генерируя до 32 действий за один вывод на NVIDIA Jetson Thor, при этом достигая частоты управления в 15 Гц. Среди моделей аналогичного размера (4 млрд параметров) Cosmos 3 Edge занимает первое место в бенчмарке VANTAGE-Bench для визуальной аналитики и демонстрирует результаты в обучении политики роботов.

Модель мира учится тому, как окружение меняется со временем. Она представляет объекты, их движение, пространственные отношения и последствия действий. Например, чтобы взять предмет, роботу нужно не только распознать его, но и понять его положение, движение захвата, возможные исходы контакта и наиболее эффективное действие. Cosmos 3 Edge объединяет эти функции в единой модели, работающей на устройстве, позволяя физическим ИИ-системам понимать текущее состояние мира, симулировать будущие сценарии и связывать их с действиями.

Архитектура Cosmos 3 Edge включает две трансформерные башни с общим представлением: авторегрессивная башня обрабатывает визуальные и текстовые токены для понимания и рассуждения, а диффузионная башня — визуальные, аудио- и экшн-токены для предсказания, генерации и нейронной симуляции. Обе башни используют общие многомодальные слои внимания, которые выравнивают информацию по языку, видео, аудио и действиям. Это позволяет модели рассуждать о сцене перед генерацией вывода. В зависимости от задачи Cosmos 3 может выдавать токены рассуждения или очищенные видео- и экшн-токены.

Cosmos 3 Edge демонстрирует, что сложные возможности ИИ-рассуждений и генерации действий теперь могут работать непосредственно на роботах и периферийных устройствах. Это критически важный шаг для создания по-настоящему автономных физических ИИ-систем, способных действовать в реальном мире без постоянной связи с облаком. Открытый доступ к модели на Hugging Face позволяет инженерам начать её внедрение уже сейчас.

Дополнительные источники

  1. https://huggingface.co/nvidia/Cosmos3-Edge
  2. https://huggingface.co/collections/nvidia/cosmos3
  3. arxiv.org
  4. nvidia.com
  5. industryidx.com
  6. kie.ai

Источники

  1. https://huggingface.co/blog/nvidia/cosmos3edge external
→ Опубликовано в Telegram: @agentic_ai_news/720