Релиз модели10 сентября 2026 г., 12:20 МСК🤖 Auto

DeepSeek-V4.1-Flash: 1M контекст, FP4 кэш и прорыв в агентах

DeepSeek выпустила мультимодальную MoE-модель с 552B параметров, способную обрабатывать 1 млн токенов при минимальных затратах памяти благодаря архитектуре CED и сжатому вниманию CSA2.

Баннер новости 7162

Архитектура: экономия ресурсов и скорость

DeepSeek-V4.1-Flash — это мультимодальная модель типа Mixture-of-Experts (MoE) с общей массой 552B параметров и дополнительными 196B параметрами Engram. Ключевая инновация заключается в радикальном снижении потребления памяти HBM и SSD, что критично для long-horizon агентов. Модель использует 1-мегабайтное окно контекста, активируя всего 8B параметров на токен при префилле и 16B при декодировании.

Главная метрика эффективности — глобальный размер KV-кэша составляет всего 890 байт на токен. Это в 4 раза меньше, чем у DeepSeek-V4-Flash, и в 437 раз меньше, чем у первой версии DeepSeek-V1. Для сравнения, в таблице ниже приведены результаты бенчмарков, где новая модель демонстрирует превосходство над конкурентами в задачах программирования и автоматизации.

Бенчмарк DeepSeek-V4.1-Flash DeepSeek-V4-Flash Opus-5 GPT-5.6 Sol
Terminal-Bench 2.1 90.6 82.7 89.1 88.8
DeepSWE v1.1 74.2 54.4 74.0 73.0
Terminal-Bench 4.0 31.2 7.0 51.8 39.9
Automation-Bench 54.8 37.7 50.3 45.8
GPQA Diamond 90.9 89.9 93.4 94.1
Codeforces (rating) 3471 3289 n/a n/a

Технические инновации: CED, CSA2 и FP4

Архитектура построена на принципе Causal Encoder-Decoder (CED). 40-слойный бэкбон разделен на 20 слоев энкодера и 20 слоев декодера. Декодер не вычисляет глобальный KV-кэш самостоятельно, а проецирует его из скрытого состояния энкодера. Это почти вдвое снижает вычислительную нагрузку при префилле. Для управления скользящим окном внимания (SWA) применяется метод Decoder SWA Bounded Replay, который переигрывает только последние 128 токенов, а не весь контекст.

Для сжатия внимания используется алгоритм Compressed Sparse Attention 2 (CSA2). Каждый слой статически выбирает один из трех режимов:

  • Full: вычисляет основной KV и индексатор K, выбирает Top-512 индексов.
  • Reindex: переиспользует KV и K от слоя Full, но пересчитывает их через свой индексатор Q.
  • Reuse: полностью переиспользует KV, K и Top-K индексы, пропуская индексатор.

Основной KV-кэш квантован до формата FP4 (E2M1) с одним масштабом E4M3 на 16 каналов. Это сокращает объем хранения по сравнению с FP8 в два раза. При этом SWA-кэш не сохраняется на SSD, а живет в распределенном пуле DRAM с TTL в несколько минут, что кардинально меняет экономику развертывания.

Обучение и доступность

Модель предварительно обучена на 45 триллионах мультимодальных токенов (соотношение текст/мультимедиа 7:1). Спартенное внимание обучалось с нуля на длине 64K без плотного разогрева, а контекст расширен до 1M на 34 триллионах токенов. Пост-обучение (post-training) проведено без новых алгоритмов, но за счет масштабного синтеза верифицируемых задач агентов и RL на гетерогенных платформах (Claude Code, Codex, OpenCode и др.).

Весы модели открыты под лицензией MIT и доступны на Hugging Face. Поддерживаются инференс через vLLM, SGLang и Transformers. Также доступна публичная API с тремя уровнями вычислительных мощностей (low, high, max reasoning).

Бенчмарки

БенчмаркDeepSeek-V4.1-FlashDeepSeek-V4-FlashGPT-5.6 SolOpus-5
Terminal-Bench 2.190.6%82.7%88.8%89.1%
DeepSWE v1.174.2%54.4%73%74%
Terminal-Bench 4.031.2%7%39.9%51.8%
Automation-Bench54.8%37.7%45.8%50.3%
GPQA Diamond90.9%89.9%94.1%93.4%
Codeforces (rating)3471rating3289rating

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: MarkTechPost ↗