Обычно самые способные модели для программной инженерии закрыты и требуют затрат. Новая открытая модель Kimi K3 от Moonshot AI, чьи результаты опубликовала Together AI, продемонстрировала в бенчмарке DeepSWE почти такое же качество кодирования, как Claude Fable 5, при этом оказавшись втрое дешевле.
Together AI сравнила Kimi K3 с Claude Fable 5 от Anthropic в его сильнейшей конфигурации на бенчмарке DeepSWE. Этот бенчмарк оценивает возможности моделей в программной инженерии, используя 113 реальных, долгосрочных запросов на фичи из действующих опенсорсных репозиториев. Каждая задача тестируется четырьмя попытками и оценивается по скрытому набору тестов, написанных вручную.
По официальной метрике DeepSWE pass@1 (решение с первой попытки), Claude Fable 5 немного впереди с 69.9% против 68.5% у Kimi K3. Однако при увеличении числа попыток Kimi K3 вырывается вперед:
- Pass@2 — Kimi K3 достигает 82.0%, тогда как Fable 5 — 80.2%.
- Pass@4 — Kimi K3 показывает 89.4%, Fable 5 — 88.5%. Это означает, что Kimi K3, хотя и менее надежна с первого раза, способна решить больше задач, если дать ей несколько попыток.
Основное преимущество Kimi K3 — цена. За один "прогон" (rollout) Kimi K3 обходится в $4.65, тогда как Claude Fable 5 в конфигурации xhigh — в $13.41. Это делает Kimi K3 в 2.8 раза эффективнее по стоимости на каждую решенную задачу: 14.7 решений за $100 против 5.3 у Fable.
Анализ показателей охвата (задач, решенных хотя бы раз) и надежности (процент успешных попыток на этих задачах) показывает, что Kimi K3 охватывает 89.4% бенчмарка, не решая лишь 12 задач (у Fable — 13). Но Fable 5 надежнее: 79.0% против 76.6% у Kimi K3 на четырех попытках, и 58 задач решены четыре из четырех раз против 45 у Kimi K3. Модели также демонстрируют высокую корреляцию по задачам (0.72) — они успешно или безуспешно справляются с почти одними и теми же задачами, поэтому их совместное использование не дает прироста разнообразия.
По языкам программирования Kimi K3 уверенно лидирует в Go (79% против 71% у Fable 5). Claude Fable 5 опережает в Python (74-68), JavaScript (70-65), TypeScript (64-60) и Rust (75-65), но Kimi K3 показывает неожиданно сильные результаты в Rust, догоняя флагмана.
Kimi K3 позиционируется как рациональный выбор по умолчанию: она предлагает почти флагманское качество кодирования, особенно на нескольких попытках, но за существенно меньшие деньги. Будучи открытой моделью, Kimi K3 позволяет командам полностью контролировать её развертывание и оптимизировать инференс через провайдеров вроде Together AI, снижая зависимость от ценовой политики закрытых моделей. Однако для задач, требующих максимальной надежности с первой попытки, Claude Fable 5 пока остается более стабильным выбором.