Мультимодальные модели, способные работать с текстом и изображениями, обычно требуют ресурсов и высокой цены. DeepSeek представила DeepSeek-V4.1-Flash, наименьшую модель в новой архитектуре, которая обещает переломить эту тенденцию, предложив существенно более низкие операционные расходы и повышенную производительность.
Модель DeepSeek-V4.1-Flash обладает нативным мультимодальным визуальным пониманием и позиционируется как первый представитель нового семейства архитектур DeepSeek. Разработчики заявляют о более высокой производительности, скорости вывода и пропускной способности, а также о масштабируемости для будущих крупных моделей.
Ключевая — это архитектура Causal Encoder–Decoder, построенная на базе MoE (Mixture-of-Experts) с 552 миллиардами параметров, но активно использует лишь 8B параметров для ввода и 16B для вывода. Такая асимметричная структура сокращает потребление памяти: KV-кэш (ключ-значение кэш) V4.1-Flash требует в 4 раза меньше HBM и в 8 раз меньше SSD-хранилища по сравнению с предыдущим поколением.
DeepSeek заявляет, что V4.1 Flash превосходит предыдущее поколение DeepSeek V4 Pro и конкурирующие модели вроде GLM5.3 и Kimi K3 по производительности, а также демонстрирует высокие результаты на ряде бенчмарков, включая GPQA Diamond (90.9) и Codeforces (3471).
В сравнении с GPT-4o mini, DeepSeek V4.1 Flash предлагает почти идентичные цены на входные токены ($0.15 против $0.22 за миллион токенов), но дешевле на выходных — на 53% ($0.66 против $0.60 за миллион токенов). Это приводит к существенной экономии для задач с большим объёмом вывода:
- Чат-боты (800 входных + 400 выходных токенов): экономия до 38%.
- Автоответчики для почты (1000 входных + 300 выходных токенов): экономия до 37%.
- Высоконагруженные API (500 входных + 200 выходных токенов, 50 000 запросов/день): экономия до 40%.
При этом стоит отметить, что GPT-4o mini все еще превосходит V4.1 Flash в некоторых аспектах качества, таких как естественность английского языка, следование сложным инструкциям и генерация кода.
Модель доступна через DeepSeek API под именем deepseek-flash и на Hugging Face (deepseek-ai/DeepSeek-V4.1-Flash). С 10 сентября 2026 года введены новые цены API с сохранением тарифов в непиковые часы (50% от пиковых). Предыдущие модели V4 Flash и V4 Flash Vision Exp выведены из эксплуатации, а запросы к deepseek-v4-pro будут перенаправлены на V4.1 Flash по его ценам.
DeepSeek-V4.1-Flash — это попытка DeepSeek закрепиться на рынке малых мультимодальных моделей, предлагая существенные выгоды в стоимости и памяти, критичные для агентных задач. Однако, несмотря на заявленное превосходство, в некоторых областях, таких как сложные инструкции или генерация кода на английском, конкуренты пока сохраняют преимущество, что требует от инженеров внимательного выбора в зависимости от специфики задачи.