В мире ИИ, где «больше» часто приравнивается к «лучше», OpenRouter добавил модель, которая бросает вызов этому правилу. На платформе стала доступна StepFun: Step 5 Preview, предлагающая впечатляющее контекстное окно в 1 000 000 токенов.
Модель StepFun: Step 5 Preview выделяется своей мультимодальностью, принимая на вход текст, изображения и видео, а на выходе генерируя текст. Это ставит её в один ряд с решениями, способными обрабатывать разнообразные данные в рамках одного запроса.
Разработчик модели, шанхайский стартап StepFun (Shanghai Jieyue Xingchen Intelligent Technology Co., Ltd), известен как один из «AI-тигров» Китая. Компания привлекла $718 млн инвестиций и конкурирует с лидерами вроде OpenAI и Anthropic. StepFun фокусируется на достижении AGI через создание мультимодальных моделей, таких как их серия «Step».
Несмотря на впечатляющий размер контекстного окна в 1 000 000 токенов, что является стандартом для многих флагманских моделей 2026 года (например, GPT-5.6, Gemini, Claude, Grok), исследования показывают, что такие большие контексты часто используются неэффективно. Модели могут «терять» информацию в середине длинного промпта, и эффективное использование контекста может падать до 45% при миллионе токенов. Это означает, что инженеры платят за токены, которые модель использует не полностью или игнорирует.
Появление StepFun: Step 5 Preview на OpenRouter знаменует собой важный шаг в доступности мультимодальных моделей. Однако оно одновременно подчёркивает растущую необходимость для инженеров понимать не только заявленные характеристики, но и реальные эксплуатационные ограничения. Вендор не предоставил метрики эффективности использования контекста для StepFun: Step 5 Preview.