Работать с неструктурированными корпоративными документами для AI-систем — задача сложная: текст, таблицы, формы и картинки нужно сначала привести к единому виду. Cohere выпустила модель Parse, которая берёт эту работу на себя, преобразуя сложные документы в структурированный Markdown.
Cohere Parse (ID модели: parse-v5.0) — это мультимодальная модель с 2,3 миллиардами параметров, разработанная для парсинга документов. Она преобразует сложные неструктурированные данные в Markdown, готовый для дальнейших AI-рабочих процессов.
Модель извлекает из документов:
- Текст в порядке чтения.
- Таблицы, списки, формы, изображения и подписи.
- Границы страниц и местоположения визуальных элементов.
Выходные данные включают:
- Markdown/HTML-контент.
- Таблицы в формате HTML.
- Ограничивающие рамки (координаты) и описания изображений.
Parse сохраняет структуру и макет документа, что облегчает его рендеринг и обработку AI-системами. Модель имеет окно контекста 8K и размер около 4,6 ГБ.
Модель доступна через Parse API, а также интегрирована в Microsoft Foundry и AWS SageMaker. Для развертывания в выделенной среде (single-tenant) Parse предлагается через Model Vault.
Однако у модели есть и ограничения: она работает только с изображениями документов, что означает необходимость предварительной конвертации PDF или PPT-файлов. Parse не поддерживает извлечение диаграмм/графиков, не выдаёт оценки уверенности в извлечении и цитаты. На SageMaker изображения должны быть переданы как base64 data URIs. Cohere позиционирует Parse как решение с привлекательным соотношением цена-производительность для высоконагруженных корпоративных задач.
Цель Parse — снять барьер в работе AI-агентов с корпоративными документами, предлагая готовый структурированный вывод. Однако требование предварительной конвертации PDF/PPT в изображения добавляет шаг в пайплайн. Модель ориентирована на высоконагруженные корпоративные сценарии, где этот этап может быть интегрирован, или где уже используются сканы документов.