Когда на рынке сотни ИИ-моделей, выбрать лучшую для своего приложения — это всегда риск: общие бенчмарки редко показывают реальную производительность в конкретном коде. OpenRouter выпустил Ori Eval, инструмент, который позволяет ИИ-агенту самостоятельно анализировать проект разработчика, тестировать модели на его собственных промптах и выбирать оптимальную на основе измеримых метрик.
Ori Eval решает проблему выбора модели, которая до сих пор часто делалась наугад — по рекомендациям или общим бенчмаркам. Эти методы не учитывают специфику конкретного приложения, его данных и промптов. Инструмент призван найти «лучшую модель для того, что вы создаёте», предоставляя доказательства вместо догадок.
Процесс оценки выглядит так:
- Разработчик запускает Ori Eval, передавая запрос своему кодинг-агенту.
- Ori Eval сканирует кодовую базу, выявляя места вызовов моделей.
- Инструмент задаёт вопросы о приоритетах: стоимость, производительность, задержка, точность вызовов инструментов.
- На основе ответов Ori Eval выбирает до пяти последних моделей-кандидатов.
- Генерируется файл
review.eval.ts, который описывает тесты. - Агент запускается с этим файлом, тестируя все выбранные модели параллельно.
- Результаты представляются в виде таблицы с метриками (процент ошибок, задержка P50, стоимость) и рекомендацией.
Среди ключевых особенностей Ori Eval — возможность автоматизировать создание тестов. Инструмент самостоятельно пишет оценочные файлы, избавляя разработчика от необходимости иметь опыт в их составлении. Ori Eval обеспечивает последовательность результатов, "замораживая" среду тестирования (harness и модель) на время прогона. Благодаря маршрутизации через OpenRouter, сравнение охватывает модели от множества провайдеров.
Оценочный файл проверяет три аспекта: вызов определённых инструментов, отсутствие вызовов нежелательных инструментов и качество открытых ответов, которые оценивает LLM-судья. Это позволяет тестировать даже сложные сценарии, например, предотвращая ошибки агента, выдающего возврат без проверки заказа. Ori Eval может быть интегрирован в CI/CD-процессы: при провале тестов сборка не проходит, что предотвращает регрессии. Тесты можно запускать по расписанию, а при появлении более производительной модели система может автоматически предложить соответствующий pull request.
Для начала работы достаточно дать команду своему кодинг-агенту: run curl -fsSL https://openrouter.ai/skills/spawn-ori-eval. Это установит Ori Eval и проведёт через процесс настройки. Инструмент требует наличия Bun — быстрого JavaScript-рантайма.
Ori Eval переводит выбор ИИ-моделей из плоскости догадок в измеримую практику, интегрируясь в привычный цикл разработки. Это позволяет не только найти оптимальную модель здесь и сейчас, но и поддерживать её актуальность в условиях постоянного появления новых решений. Однако эффективность LLM-судьи и реальные затраты на регулярные прогоны таких тестов ещё предстоит оценить на практике.