Оценка поиска информации для RAG-систем, особенно тех, что работают с ИИ-агентами, часто была нереалистичной. Perplexity выпустила Q2D-Web — бенчмарк и публичный рейтинг, который впервые позволит измерить качество поиска в масштабе, близком к реальному.
Q2D-Web — это первый бенчмарк, который масштабируется сразу по три измерениям: он включает 190 миллионов веб-документов, почти 70 тысяч запросов, переформулированных агентами, и в среднем 99.6 релевантных документов на запрос. Это превосходит существующие открытые аналоги вроде MS MARCO Web Search.
Бенчмарк основан на обезличенном производственном поисковом трафике Perplexity за девять месяцев. Он использует запросы, которые генерируют сами ИИ-агенты. Это делает оценку максимально приближенной к реальным сценариям использования.
Для снижения предвзятости и увеличения полноты Q2D-Web использует три источника оценки релевантности: ссылки, сделанные агентами; результаты внутреннего веб-ранжирования; и дополнительные суждения LLM. Такой подход даёт более глубокую и надёжную картину производительности моделей.
Q2D-Web закрывает важный пробел в оценке поиска для агентских RAG-систем, предлагая масштаб и реалистичность. Однако Perplexity честно предупреждает: их собственные модели могут иметь "преимущество распределения", так как бенчмарк основан на производственных данных компании. Это стоит учитывать при сравнении результатов.