AI News Watcher
Wednesday, Aug 12, 2026  ·  Daily briefing
Feed Telegram
Daily briefing · By AI News Watcher · Aug 12, 2026 · 2 min read · OpenRouter ← Back to feed

OpenRouter: Удвойте качество веб-поиска LLM — просто дайте агенту больше попыток daily

Увеличение числа попыток поиска удваивает качество и может снизить время ответа — но провалы бьют по затратам.

OpenRouter: Удвойте качество веб-поиска LLM — просто дайте агенту больше попыток
Редакция · Daily briefing

Обычно инженеры начинают оптимизацию веб-поиска для LLM-агентов с выбора модели или движка. Однако, согласно новым бенчмаркам OpenRouter, самый прирост качества даёт не смена модели, а увеличение числа попыток поиска.

OpenRouter представил интерактивные таблицы лидеров, которые оценивают различные конфигурации веб-поиска для LLM-агентов. Они позволяют сравнить движки, глубину поиска и модели по качеству, стоимости и скорости на четырёх наборах задач: BrowseComp (поиск сложных фактов), DeepSearchQA (многошаговые вопросы), WideSearch (сбор широких табличных данных) и HLE (экспертные экзаменационные вопросы).

Ключевой вывод: повышение глубины поиска (числа попыток) улучшает качество больше, чем любой другой фактор. Например, на тесте BrowseComp увеличение числа попыток с одной до двадцати пяти удваивает результат, при этом стоимость запроса возрастает лишь в 2.5–7 раз. В некоторых случаях, особенно для моделей OpenAI, большее число попыток даже сокращает время ответа, поскольку агенты тратят меньше времени на рассуждения при ограниченном бюджете. Однако, для простых задач или при высоком проценте ошибок, расширенный бюджет поиска может быть невыгоден: модели исчерпывают его, пытаясь найти ответ, даже если в итоге терпят неудачу. В среднем, на BrowseComp правильные ответы находились за 10.3 попытки, тогда как ошибочные запросы доходили до 19.7.

После глубины поиска, наиболее важен выбор модели. Разница в качестве между и бюджетными моделями составляет в среднем 15 баллов, тогда как между различными поисковыми движками — около 10 баллов. Для дорогих моделей разница в стоимости между самым дешёвым и самым дорогим движком может достигать 2.5 раза, для бюджетных — 1.5 раза. OpenRouter отмечает, что эти сравнения возможны благодаря их серверному инструменту, который стандартизирует поведение поиска независимо от используемого провайдера модели.

Бенчмарки проводятся через публичный API OpenRouter с использованием открытого фреймворка. Для точности сравнения измеряется только производительность поиска: модели читают только выдержки из результатов, без извлечения полных страниц и выполнения кода. Скоринг ответов строгий — «правильно» или «неправильно».

OpenRouter рекомендует использовать эти таблицы как стартовый шорт-лист для выбора конфигурации. Инженерам стоит сначала определить набор задач, наиболее близкий к их рабочей нагрузке, затем выбрать наименее затратную конфигурацию, которая находится в пределах нескольких процентов от лучшего результата, и провести собственные тесты. На платформе можно настроить следующие параметры:

Данные OpenRouter показывают, что простой подход к увеличению глубины поиска может улучшить качество ответов LLM-агентов, часто с меньшими затратами, чем смена модели или движка. Однако, эти бенчмарки — лишь отправная точка; окончательная оптимизация потребует собственных тестов, особенно для рабочих нагрузок с высокой долей провалов.

Дополнительные источники

  1. https://openrouter.ai/benchmarks
  2. https://openrouter.ai/benchmarks/browsecomp
  3. https://openrouter.ai/benchmarks/deepsearchqa
  4. https://openrouter.ai/benchmarks/widesearch
  5. https://openrouter.ai/benchmarks/hle
  6. https://openrouter.ai/docs/guides/features/plugins/web-search
  7. https://openrouter.ai/docs/guides/features/server-tools/web-search
  8. https://github.com/OpenRouterTeam/benchmark-harness
  9. github.com
  10. devtune.ai
  11. venice.ai

Источники

  1. https://openrouter.ai/blog/announcements/web-search-benchmark/ news
  2. https://openrouter.ai/bytedance-seed/seed-2-1-turbo external
  3. https://openrouter.ai/bytedance-seed/seed-2.0-code external
  4. https://openrouter.ai/qwen/qwen3.8-2.4t-a95b external
  5. https://openrouter.ai/deepseek/deepseek-v4-pro-0813 external
  6. https://openrouter.ai/x-ai/grok-4.6 external
→ Опубликовано в Telegram: @agentic_ai_news/855