AI News Watcher
Monday, Aug 3, 2026  ·  Daily briefing
Feed Telegram
Daily briefing · By AI News Watcher · Aug 03, 2026 · 2 min read · OpenRouter ← Back to feed

Ori Eval от OpenRouter: агент сам подбирает ИИ-модель — точно под ваш код daily

Тестирует модели прямо в вашем коде, а не по общим бенчмаркам — и ловит регрессии в CI.

Ori Eval от OpenRouter: агент сам подбирает ИИ-модель — точно под ваш код
Редакция · Daily briefing

Когда на рынке сотни ИИ-моделей, выбрать лучшую для своего приложения — это всегда риск: общие бенчмарки редко показывают реальную производительность в конкретном коде. OpenRouter выпустил Ori Eval, инструмент, который позволяет ИИ-агенту самостоятельно анализировать проект разработчика, тестировать модели на его собственных промптах и выбирать оптимальную на основе измеримых метрик.

Ori Eval решает проблему выбора модели, которая до сих пор часто делалась наугад — по рекомендациям или общим бенчмаркам. Эти методы не учитывают специфику конкретного приложения, его данных и промптов. Инструмент призван найти «лучшую модель для того, что вы создаёте», предоставляя доказательства вместо догадок.

Процесс оценки выглядит так:

Среди ключевых особенностей Ori Eval — возможность автоматизировать создание тестов. Инструмент самостоятельно пишет оценочные файлы, избавляя разработчика от необходимости иметь опыт в их составлении. Ori Eval обеспечивает последовательность результатов, "замораживая" среду тестирования (harness и модель) на время прогона. Благодаря маршрутизации через OpenRouter, сравнение охватывает модели от множества провайдеров.

Оценочный файл проверяет три аспекта: вызов определённых инструментов, отсутствие вызовов нежелательных инструментов и качество открытых ответов, которые оценивает LLM-судья. Это позволяет тестировать даже сложные сценарии, например, предотвращая ошибки агента, выдающего возврат без проверки заказа. Ori Eval может быть интегрирован в CI/CD-процессы: при провале тестов сборка не проходит, что предотвращает регрессии. Тесты можно запускать по расписанию, а при появлении более производительной модели система может автоматически предложить соответствующий pull request.

Для начала работы достаточно дать команду своему кодинг-агенту: run curl -fsSL https://openrouter.ai/skills/spawn-ori-eval. Это установит Ori Eval и проведёт через процесс настройки. Инструмент требует наличия Bun — быстрого JavaScript-рантайма.

Ori Eval переводит выбор ИИ-моделей из плоскости догадок в измеримую практику, интегрируясь в привычный цикл разработки. Это позволяет не только найти оптимальную модель здесь и сейчас, но и поддерживать её актуальность в условиях постоянного появления новых решений. Однако эффективность LLM-судьи и реальные затраты на регулярные прогоны таких тестов ещё предстоит оценить на практике.

Дополнительные источники

  1. https://openrouter.ai/ori/eval
  2. https://openrouter.ai/docs/guides/ori/eval
  3. https://bun.sh
  4. arize.com
  5. arize.com
  6. ibm.com
  7. inworld.ai
  8. zylos.ai

Источники

  1. https://openrouter.ai/blog/announcements/ori-eval/ news
  2. https://openrouter.ai/qwen/qwen3.8-max external
→ Опубликовано в Telegram: @agentic_ai_news/810