Понять, что животное внутри забора, для VLM-модели обычно не проблема. Но если забор начнет двигаться или изменит форму, сохранится ли это понимание? Новый бенчмарк MindTopo от Microsoft показал, что современные мультимодальные модели критически плохо справляются с такими динамическими задачами, теряя базовое понимание пространственных связей.
MindTopo — это новый бенчмарк для оценки топологического мышления в ИИ, который проверяет, способны ли мультимодальные модели (VLM) понимать понятия связности, включения, порядка, разделения и узлов. Главный вывод исследования: текущие VLM-ы хуже справляются с динамическими задачами, чем со статическим распознаванием.
Бенчмарк оценивает два уровня когнитивных способностей. Задачи распознавания требуют от модели отвечать на вопросы о топологической структуре статичных сцен (например, связаны ли две точки в лабиринте). Задачи планирования заставляют модель взаимодействовать с симулированной средой, выбирая действия, которые должны создать, сохранить или удалить определенные топологические отношения. Модели часто «теряют нить» именно при планировании, предлагая действия, нарушающие физические ограничения или теряя из виду структурные связи по мере изменения сцены.
Этот пробел критичен для развития ИИ в робототехнике и интерактивных средах. Понимание того, что остается связанным, включенным или упорядоченным, необходимо для надежного принятия решений, например, при манипуляции объектами, навигации или при выполнении задач, где объекты могут сгибаться, растягиваться или деформироваться.
MindTopo ясно показывает: для создания по-настоящему адаптивных ИИ, способных к сложным манипуляциям и навигации, недостаточно просто улучшать распознавание объектов. Требуется принципиально новое понимание того, как модели воспринимают и обрабатывают меняющиеся пространственные отношения.