До сих пор обработка разных типов данных — от документов до видео — требовала отдельных моделей или сложных цепочек. Tencent Hunyuan выпустила Youtu-Parsing-Omni, одну компактную модель, которая может анализировать и структурировать информацию из семи различных модальностей в унифицированный JSON.
Youtu-Parsing-Omni — это унимодальная модель с 5 миллиардами параметров. Она принимает на вход документы, естественные изображения, диаграммы, геометрические фигуры, аудиоклипы и аудиовизуальное видео, выдавая структурированный JSON. Модель способна извлекать как перцептивные аспекты, такие как элементы макета, текст, таблицы, формулы, ограничивающие рамки, временные метки, результаты ASR и OCR, так и когнитивные — подписи и нарративы.
Ключевая особенность модели — унифицированная JSON-схема. Она используется для всех семи семейств парсинга и управляется заданным запросом. Это позволяет обрабатывать разнородные данные с помощью одного подхода и получать согласованный вывод. Omni-кодировщик поддерживает изображения, аудио и чередующиеся аудиовизуальные видеовходы (кадры + звуковая дорожка) в одной модели.
Несмотря на свой компактный размер, Youtu-Parsing-Omni демонстрирует высокую производительность. Модель занимает первое место по показателю Overall в бенчмарке OmniDocBench и второе место после Gemini-3-Pro в OmniParsingBench. Она также показывает конкурентные результаты со специализированными моделями в распознавании химических структур (ChemOCR) и нотной записи (PDMX).
Модель доступна на Hugging Face (tencent/Youtu-Parsing-Omni) и поставляется с плагином vLLM, настройками для развертывания и примерами использования. Это упрощает её интеграцию и эксплуатацию.
Выпуск Youtu-Parsing-Omni — важный шаг к созданию по-настоящему универсальных мультимодальных ИИ, способных понимать и структурировать информацию из любого источника с помощью единого подхода. Однако вендор не предоставил подробной информации о конкретных данных, на которых обучалась модель, что затрудняет оценку её потенциальных смещений и ограничений.