AI News Watcher
Monday, Aug 31, 2026  ·  Daily briefing
Feed Telegram
Daily briefing · By AI News Watcher · Aug 31, 2026 · 2 min read · DeepSeek ← Back to feed

DeepSeek-V4-Flash-Vision-Exp: открытый агент видит — и действует daily

Экспериментальная модель с MIT-лицензией, которая в задачах агентов почти догоняет Opus-4.8.

Лицензия
MIT
Доступ
API
DeepSeek-V4-Flash-Vision-Exp: открытый агент видит — и действует
Редакция · Daily briefing

Большинство агентов, способных работать с изображениями, недоступны или имеют закрытый код. DeepSeek выпустила DeepSeek-V4-Flash-Vision-Exp — свою первую экспериментальную мультимодальную модель, которая «видит», действует и распространяется по лицензии MIT.

DeepSeek-V4-Flash-Vision-Exp — это первая мультимодальная модель в семействе DeepSeek-V4, построенная на архитектуре DeepSeek-V4-Flash. Она получила дополнительные модули и обучение для работы с визуальными данными. По сравнению с DeepSeek-V4-Flash-0731, новая модель улучшила возможности мультимодальных агентов, сохранив при этом производительность в задачах текстовых агентов. С 21 августа 2026 года модель доступна через API DeepSeek.

На бенчмарках, требующих визуального понимания, DeepSeek-V4-Flash-Vision-Exp демонстрирует заметный скачок. Например, в тестах на выполнение агентских задач:

Репозиторий DeepSeek-V4-Flash-Vision-Exp содержит токенизатор, эталонную реализацию кодирования промптов и минимальную PyTorch-реализацию инференса. Она охватывает визуальный кодировщик и выравниватель, DFlash-внимание, MoE (Mixture of Experts), Hyper-Connections и прямой путь DSpark. Модель поддерживает как JSON-блоки контента в стиле OpenAI, так и компактную TXT-нотацию <image>path</image>. Размер модели составляет 305 миллиардов параметров, с поддержкой типов тензоров BF16, F32, F8_E4M3, I8, I64.

DeepSeek-V4-Flash-Vision-Exp показывает, что мультимодальные агенты с открытым кодом способны конкурировать с лидерами рынка, такими как Opus-4.8, предлагая разработчикам гибкий инструмент. Однако статус «экспериментальная» и огромный размер модели указывают на то, что для широкого внедрения потребуется время и дальнейшая оптимизация.

Дополнительные источники

  1. DeepSeek-V4-Flash-0731
  2. DeepSeek-V4-Flash-Vision-Exp Discussions
  3. aidiscoverydigest.com
  4. updates
  5. llm-stats.com

Источники

  1. https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp docs
→ Опубликовано в Telegram: @agentic_ai_news/950