Генерация 3D-объектов по тексту или изображению продолжает упрощаться. Tencent ARC Lab выпустила на Hugging Face две модели WorldCrafter, Base и Fast, для создания такого контента.
WorldCrafter-Base содержит основные веса трансформера, адаптер камеры и LoRA (Low-Rank Adaptation) для инференса. Она использует общие компоненты, такие как RepEncoder, текстовый кодировщик, токенизатор, VAE (Variational AutoEncoder) и планировщик, которые также присутствуют в версии Fast.
WorldCrafter-Fast — это отдельная, более быстрая модель, не требующая файлов WorldCrafter-Base для работы. Она поставляется с собственными автономными весами и предназначена для генерации видео из изображения, видео из текста и работы в интерактивных демо.
Для ускорения работы WorldCrafter-Fast использует оптимизированные процессы:
- Image-to-video — применяет 5 шагов с высоким шумом и 1 шаг с низким шумом на фрагмент.
- Text-to-video — для первого фрагмента используется 4 шага с высоким шумом и 8 шагов с низким шумом, а для последующих — 2 шага с высоким и 4 с низким.
- Компиляция модели необязательна, активируется флагом
--enable-compile.
Tencent ARC Lab активно занимается исследованиями в области компьютерного зрения и генерации 3D. Ранее лаборатория уже публиковала работы по пиксельно-выровненной 3D-генерации, например, Pixal3D. Выпуск WorldCrafter ставит Tencent в ряд с такими игроками, как OpenAI, предлагающей модель Shap-E для генерации 3D-объектов из текста.
WorldCrafter, особенно её быстрая и автономная версия, предлагает инженерам готовый и гибкий инструмент для генерации 3D-контента. Однако, как и в случае со многими новыми релизами, конкретные данные о производительности и сравнения с конкурирующими моделями пока отсутствуют.