AI News Watcher
Wednesday, Sep 9, 2026  ·  Daily briefing
Feed Telegram
Daily briefing · By AI News Watcher · Sep 09, 2026 · 1 min read · Perplexity ← Back to feed

Perplexity выпустила Q2D-Web: оценит поиск для ИИ-агентов в реальном масштабе daily

190 млн документов и 70 тысяч запросов — из реального поискового трафика.

Perplexity выпустила Q2D-Web: оценит поиск для ИИ-агентов в реальном масштабе
Редакция · Daily briefing

Оценка поиска информации для RAG-систем, особенно тех, что работают с ИИ-агентами, часто была нереалистичной. Perplexity выпустила Q2D-Web — бенчмарк и публичный рейтинг, который впервые позволит измерить качество поиска в масштабе, близком к реальному.

Q2D-Web — это первый бенчмарк, который масштабируется сразу по три измерениям: он включает 190 миллионов веб-документов, почти 70 тысяч запросов, переформулированных агентами, и в среднем 99.6 релевантных документов на запрос. Это превосходит существующие открытые аналоги вроде MS MARCO Web Search.

Бенчмарк основан на обезличенном производственном поисковом трафике Perplexity за девять месяцев. Он использует запросы, которые генерируют сами ИИ-агенты. Это делает оценку максимально приближенной к реальным сценариям использования.

Для снижения предвзятости и увеличения полноты Q2D-Web использует три источника оценки релевантности: ссылки, сделанные агентами; результаты внутреннего веб-ранжирования; и дополнительные суждения LLM. Такой подход даёт более глубокую и надёжную картину производительности моделей.

Q2D-Web закрывает важный пробел в оценке поиска для агентских RAG-систем, предлагая масштаб и реалистичность. Однако Perplexity честно предупреждает: их собственные модели могут иметь "преимущество распределения", так как бенчмарк основан на производственных данных компании. Это стоит учитывать при сравнении результатов.

Дополнительные источники

  1. Q2D-Web: A Large-Scale Benchmark for Retrieval in Agentic RAG Systems
  2. aclanthology.org

Источники

  1. https://www.perplexity.ai/hub/blog/q2d-web blog
→ Опубликовано в Telegram: @agentic_ai_news/1004