Выбор между дорогим и точным или дешевым и настойчивым ИИ-инженером больше не стоит: Together AI показала, как их совместное использование бьет оба варианта по отдельности. Новое исследование демонстрирует, что комбинация DeepSeek V4 Pro 0813 и GPT-5.6 Sol решает 83% задач на бенчмарке DeepSWE, превосходя GPT-5.6 Sol в одиночку на 10% по точности и на 60% по стоимости.
Стратегия, предложенная Together AI, заключается в каскадном использовании моделей: DeepSeek V4 Pro 0813 запускается первым, а в случае неудачи задача передается GPT-5.6 Sol. Такой подход позволил достичь 83,0% успеха на бенчмарке DeepSWE при средней стоимости $3.35 за задачу. Это на 10% точнее, чем использование GPT-5.6 Sol в одиночку (72,7%), и на 60% дешевле, ведь GPT-5.6 Sol сам по себе обходится в $8.37 за задачу.
DeepSWE — это бенчмарк из 113 оригинальных, долгосрочных задач по программной инженерии, разработанный для оценки агентов-кодировщиков. В отличие от других бенчмарков, DeepSWE использует новые задачи, не виденные моделями в обучении, и проверяет их вручную написанными верификаторами.
DeepSeek V4 Pro 0813 выделяется своей стоимостью: $0.24 за попытку против $8.37 у GPT-5.6 Sol, что делает его в 35 раз дешевле. Хотя на первой попытке (pass@1) DeepSeek V4 Pro уступает (62,8% против 72,7% у Sol), он демонстрирует лучшую результативность при нескольких попытках: 88,5% на pass@4 против 85,8% у Sol. Это указывает на его широкий охват задач. Кроме того, DeepSeek V4 Pro безопаснее в работе: 11% его сбоев приводят к регрессиям (поломке существующих тестов) против 20% у Sol. Модель также превосходит Sol в задачах на языке Rust.
GPT-5.6 Sol, напротив, является "флагманом точности": он лидирует по pass@1 (72,7%), быстрее справляется с задачами (17 минут и 53 шага против 35 минут и 146 шагов у Pro) и выдает более короткие ответы (59 тыс. Токенов против 101 тыс.). Его надежность выше (84,5% против 71%), и он уверенно выигрывает в 6 из 8 предметных областей кодирования и в четырех из пяти языков программирования, включая Python, Go, TypeScript и JavaScript.
Ключевая идея Together AI — маршрутизация между этими моделями. Запуск DeepSeek V4 Pro 0813 первым позволяет снять большую часть нагрузки с более дорогого Sol. Если Pro не справляется, задача передается Sol для второй, независимой попытки. Такой каскад не только превосходит каждую модель по отдельности (83,0% против 72,7% для Sol), но даже обходит "идеальный" одноразовый маршрутизатор (80,8%), который всегда выбирает лучшую модель для первой попытки. При этом стоимость решения задачи сокращается до $3.35, что менее половины цены Sol в одиночку.
Исследование Together AI показывает, что в сложных инженерных задачах выбор одной "лучшей" модели может быть неоптимальным. Эффективная оркестрация нескольких LLM, где дешевая модель работает как первый фильтр, а дорогая — как "спасатель" для сложных случаев, позволяет добиться максимальной точности при меньших затратах. Это меняет подход к построению агентов-кодировщиков, предлагая экономически выгодную альтернативу использованию только самых дорогих и производительных моделей.