AI News Watcher
Thursday, Sep 10, 2026  ·  Daily briefing
Feed Telegram
Daily briefing · By AI News Watcher · Sep 10, 2026 · 2 min read · DeepSeek ← Back to feed

DeepSeek-V4.1-Flash: новая архитектура в 4 раза сокращает память — и удешевляет мультимодальность daily

Новая MoE-архитектура активирует лишь малую часть из 552B параметров — снижая расходы на агентные задачи и мультимодальность.

Цена
$0.22 за миллион токенов
Доступ
Hugging Face, API
DeepSeek-V4.1-Flash: новая архитектура в 4 раза сокращает память — и удешевляет мультимодальность
Редакция · Daily briefing

Мультимодальные модели, способные работать с текстом и изображениями, обычно требуют ресурсов и высокой цены. DeepSeek представила DeepSeek-V4.1-Flash, наименьшую модель в новой архитектуре, которая обещает переломить эту тенденцию, предложив существенно более низкие операционные расходы и повышенную производительность.

Модель DeepSeek-V4.1-Flash обладает нативным мультимодальным визуальным пониманием и позиционируется как первый представитель нового семейства архитектур DeepSeek. Разработчики заявляют о более высокой производительности, скорости вывода и пропускной способности, а также о масштабируемости для будущих крупных моделей.

Ключевая — это архитектура Causal Encoder–Decoder, построенная на базе MoE (Mixture-of-Experts) с 552 миллиардами параметров, но активно использует лишь 8B параметров для ввода и 16B для вывода. Такая асимметричная структура сокращает потребление памяти: KV-кэш (ключ-значение кэш) V4.1-Flash требует в 4 раза меньше HBM и в 8 раз меньше SSD-хранилища по сравнению с предыдущим поколением.

DeepSeek заявляет, что V4.1 Flash превосходит предыдущее поколение DeepSeek V4 Pro и конкурирующие модели вроде GLM5.3 и Kimi K3 по производительности, а также демонстрирует высокие результаты на ряде бенчмарков, включая GPQA Diamond (90.9) и Codeforces (3471).

В сравнении с GPT-4o mini, DeepSeek V4.1 Flash предлагает почти идентичные цены на входные токены ($0.15 против $0.22 за миллион токенов), но дешевле на выходных — на 53% ($0.66 против $0.60 за миллион токенов). Это приводит к существенной экономии для задач с большим объёмом вывода:

При этом стоит отметить, что GPT-4o mini все еще превосходит V4.1 Flash в некоторых аспектах качества, таких как естественность английского языка, следование сложным инструкциям и генерация кода.

Модель доступна через DeepSeek API под именем deepseek-flash и на Hugging Face (deepseek-ai/DeepSeek-V4.1-Flash). С 10 сентября 2026 года введены новые цены API с сохранением тарифов в непиковые часы (50% от пиковых). Предыдущие модели V4 Flash и V4 Flash Vision Exp выведены из эксплуатации, а запросы к deepseek-v4-pro будут перенаправлены на V4.1 Flash по его ценам.

DeepSeek-V4.1-Flash — это попытка DeepSeek закрепиться на рынке малых мультимодальных моделей, предлагая существенные выгоды в стоимости и памяти, критичные для агентных задач. Однако, несмотря на заявленное превосходство, в некоторых областях, таких как сложные инструкции или генерация кода на английском, конкуренты пока сохраняют преимущество, что требует от инженеров внимательного выбора в зависимости от специфики задачи.

Дополнительные источники

  1. getapipulse.com
  2. biggo.com

Источники

  1. https://api-docs.deepseek.com/updates docs
  2. https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash docs
  3. https://api-docs.deepseek.com/news/news260910 docs
→ Опубликовано в Telegram: @agentic_ai_news/1007