Создание реалистичного видеоконтента и управление роботами в физическом мире кажутся двумя разными задачами для ИИ. Однако Black Forest Labs представила FLUX 3 — мультимодальную модель, которая одинаково хорошо справляется с обеими, обучаясь на изображениях, видео и аудио для единого представления о мире.
Black Forest Labs (BFL) выпустила FLUX 3 — мультимодальную фундаментальную модель. Она учится на изображениях, видео и аудио одновременно, чтобы сформировать единое представление о реальном мире. Цель — понять, как движутся объекты, как звучат события и как эти элементы связаны между собой.
Модель способна генерировать разнообразный контент, смешивая модальности. Её ключевые возможности включают:
- Видео с аудио — создание клипов до 20 секунд из текста, изображений или других видео. Поддерживается генерация продолжения видео и аудио, а также переходы между ключевыми кадрами.
- Стили и форматы — широкий выбор визуальных стилей, от имитации любительской съемки до кинематографичных сцен, и различных соотношений сторон.
- Связывание клипов — возможность объединять отдельные фрагменты в более длинные последовательности.
- Типографика и диалоги — генерация текста и многоязычных диалогов.
Помимо создания контента, FLUX 3 служит основой для FLUX-mimic — видео-экшн-модели, разработанной совместно с mimic robotics. Эта модель уже работает на роботах. Они прошли испытания и внедрены на производстве Audi, выполняя сложные манипуляции в промышленных условиях.
Black Forest Labs объясняет, что создание реалистичного видео и управление роботами требуют общего понимания мира. Чтобы генерировать видео, модель должна научиться имитировать физические законы: контакт, движение, вес, причину и следствие. Эти же знания лежат в основе предсказания действий роботов. Добавление способности управлять роботами временно снизило качество генерации видео на 10%, но после 3500 шагов обучения модель восстановила прежнюю производительность. Она освоила новую модальность без потери основных возможностей. Это подтверждает идею, что обе задачи опираются на единый "позвоночник" — общее представление о физическом мире.
FLUX 3 ставит под сомнение традиционное разделение ИИ на узкоспециализированные модели для контента и робототехники. Это указывает на возможный путь к созданию более универсального ИИ, способного воспринимать, предсказывать и действовать как в цифровой, так и в физической среде. Однако модель пока находится на стадии раннего доступа, и её полные возможности ещё предстоит оценить.