Когда нужно сгенерировать изображение, точно контролируя каждый аспект, часто приходится выбирать: либо текстовый промпт, либо референсные картинки. Теперь такого выбора нет. Runway Dev добавил в свой API модель Meta Muse Image, которая комбинирует до десяти исходных изображений с текстовым запросом.
Модель, впервые анонсированная Meta AI в июле 2026 года, способна генерировать изображения по тексту, а также редактировать и объединять несколько референсных изображений в соответствии с запросом. Это позволяет не просто создавать новое, но и точно направлять ИИ на основе уже имеющегося визуала.
Инженеры могут использовать Meta Muse Image через конечную точку text to image в Runway Dev. Модель принимает промпты до 4000 символов и до десяти референсных изображений. Можно запросить от 1 до 10 выходных изображений, а также выбрать одно из восьми поддерживаемых соотношений сторон или задействовать автоматическое определение. Тарификация идёт из расчёта 1 кредит за каждое сгенерированное изображение, умноженный на запрошенное количество (outputCount).
Эта функциональность выделяет Muse Image на фоне конкурентов. Например, функция /blend у Midjourney позволяет комбинировать до пяти изображений, но при этом невозможно добавить текстовый промпт, и результат всегда квадратный. DALL-E 3 через API на сегодня не принимает изображения как входные данные для генерации вариаций или редактирования, требуя обходить это через описание картинки GPT-4.
Возможность одновременно управлять генерацией через текст и до десяти исходников даёт инженерам уникальный уровень контроля. Это отличает Muse Image от других моделей и может стать важным инструментом для тех, кому нужна предельная точность в визуальных проектах. Однако фактическое качество такого комбинирования в сложных сценариях предстоит проверить.