Чтобы ИИ мог осмысленно работать с текстом, изображениями и видео одновременно, ему нужен единый способ их представления. Tencent Hunyuan выпустил серию мультимодальных моделей встраивания WeMM-Embedding, которые делают именно это.
Серия моделей WeMM-Embedding от Tencent Hunyuan (версии 2B, 4B, 9B) умеет преобразовывать текст, изображения, видео и сканы документов в единые L2-нормализованные векторы. Это позволяет сопоставлять и искать информацию между разными типами контента, например, находить видео по текстовому описанию или изображения, связанные с конкретным документом.
Все версии WeMM-Embedding построены на архитектуре Qwen3.5. Они выдают эмбеддинги разной размерности: 2B-модель — 2048-мерные векторы, 4B — 2560-мерные, а 9B — 4096-мерные. Такая вариативность позволяет разработчикам выбирать оптимальный баланс между детализацией представления и потреблением вычислительных ресурсов. Важно отметить, что аудиоввод модели не поддерживают.
Модели доступны на Hugging Face под свободной лицензией Apache 2.0, что открывает их для широкого коммерческого и исследовательского применения. Для развертывания WeMM-Embedding предусмотрена поддержка фреймворков:
- vLLM 0.27.0 — для эффективной обработки запросов.
- SGLang 0.5.9 — для гибкого управления выводом. Эффективность моделей подтверждена высокими результатами в мультимодальных бенчмарках MMEB-v2 и MMEB-v3.
Выпуск WeMM-Embedding от Tencent Hunyuan показывает, что компания активно развивает открытые мультимодальные решения. Эти модели дают разработчикам готовый инструмент для работы с разнообразным контентом. Однако в анонсе нет конкретных примеров использования или сравнения производительности с другими крупными мультимодальными моделями встраивания на реальных задачах.