Мультимодальные модели, способные обрабатывать изображения на уровне флагманов рынка, обычно стоят дорого. DeepSeek, известный своими экономичными решениями, выпустил экспериментальную модель, чьё визуальное понимание приближается к Opus-4.8 — она уже доступна на OpenRouter.
Новая модель, DeepSeek V4 Flash Vision Exp, появилась на платформе OpenRouter 21 августа 2026 года. Она позиционируется как экспериментальная мультимодальная модель, ориентированная на визуальное понимание.
DeepSeek V4 Flash Vision Exp построена на базе архитектуры DeepSeek-V4-Flash. Это разреженная MoE-модель (mixture-of-experts) с 13 миллиардами активных параметров из общих 284 миллиардов. Модель способна преобразовывать комбинации текста и изображений в текст, поддерживая контекстное окно до 1 миллиона токенов (1048576). По заявлению разработчика, её чисто текстовые возможности соответствуют базовой DeepSeek-V4-Flash.
Главная особенность Vision Exp — визуальное понимание и производительность агента, которые, по оценкам, приближаются к уровню Opus-4.8. DeepSeek традиционно известен тем, что предлагает производительность, сравнимую с топовыми проприетарными моделями от OpenAI, Anthropic и Google, но по более низкой цене.
На OpenRouter модель доступна с активным бесплатным лимитом. После превышения лимита стоимость для провайдера DeepSeek составляет от $0.22 до $0.44 за 1 миллион токенов на вход и от $0.66 до $1.32 за 1 миллион токенов на выход.
Выпуск DeepSeek V4 Flash Vision Exp указывает на то, что компания продолжает свою стратегию по демократизации доступа к AI-возможностям. Если заявленные метрики визуального понимания подтвердятся независимыми тестами, это может сделать высококачественную мультимодальную обработку изображений и текста более доступной, хотя модель пока имеет статус экспериментальной.