AI News Watcher
Friday, Oct 9, 2026  ·  Daily briefing
Feed Telegram
Daily briefing · By AI News Watcher · Oct 09, 2026 · 1 min read · Tencent Hunyuan ← Back to feed

Tencent Youtu-Parsing-Omni: одна 5B-модель разбирает видео, аудио и документы в единый JSON daily

Единая схема для семи типов данных — и опережает конкурентов при малом размере.

Tencent Youtu-Parsing-Omni: одна 5B-модель разбирает видео, аудио и документы в единый JSON
Редакция · Daily briefing

До сих пор обработка разных типов данных — от документов до видео — требовала отдельных моделей или сложных цепочек. Tencent Hunyuan выпустила Youtu-Parsing-Omni, одну компактную модель, которая может анализировать и структурировать информацию из семи различных модальностей в унифицированный JSON.

Youtu-Parsing-Omni — это унимодальная модель с 5 миллиардами параметров. Она принимает на вход документы, естественные изображения, диаграммы, геометрические фигуры, аудиоклипы и аудиовизуальное видео, выдавая структурированный JSON. Модель способна извлекать как перцептивные аспекты, такие как элементы макета, текст, таблицы, формулы, ограничивающие рамки, временные метки, результаты ASR и OCR, так и когнитивные — подписи и нарративы.

Ключевая особенность модели — унифицированная JSON-схема. Она используется для всех семи семейств парсинга и управляется заданным запросом. Это позволяет обрабатывать разнородные данные с помощью одного подхода и получать согласованный вывод. Omni-кодировщик поддерживает изображения, аудио и чередующиеся аудиовизуальные видеовходы (кадры + звуковая дорожка) в одной модели.

Несмотря на свой компактный размер, Youtu-Parsing-Omni демонстрирует высокую производительность. Модель занимает первое место по показателю Overall в бенчмарке OmniDocBench и второе место после Gemini-3-Pro в OmniParsingBench. Она также показывает конкурентные результаты со специализированными моделями в распознавании химических структур (ChemOCR) и нотной записи (PDMX).

Модель доступна на Hugging Face (tencent/Youtu-Parsing-Omni) и поставляется с плагином vLLM, настройками для развертывания и примерами использования. Это упрощает её интеграцию и эксплуатацию.

Выпуск Youtu-Parsing-Omni — важный шаг к созданию по-настоящему универсальных мультимодальных ИИ, способных понимать и структурировать информацию из любого источника с помощью единого подхода. Однако вендор не предоставил подробной информации о конкретных данных, на которых обучалась модель, что затрудняет оценку её потенциальных смещений и ограничений.

Дополнительные источники

  1. https://arxiv.org/abs/2601.20430
  2. galileo.ai
  3. launchlive.studio
  4. arxiv.org
  5. omdena.com
  6. huggingface.co

Источники

  1. https://huggingface.co/tencent/Youtu-Parsing-Omni docs
→ Опубликовано в Telegram: @agentic_ai_news/1172