Архитектура: экономия ресурсов и скорость
DeepSeek-V4.1-Flash — это мультимодальная модель типа Mixture-of-Experts (MoE) с общей массой 552B параметров и дополнительными 196B параметрами Engram. Ключевая инновация заключается в радикальном снижении потребления памяти HBM и SSD, что критично для long-horizon агентов. Модель использует 1-мегабайтное окно контекста, активируя всего 8B параметров на токен при префилле и 16B при декодировании.
Главная метрика эффективности — глобальный размер KV-кэша составляет всего 890 байт на токен. Это в 4 раза меньше, чем у DeepSeek-V4-Flash, и в 437 раз меньше, чем у первой версии DeepSeek-V1. Для сравнения, в таблице ниже приведены результаты бенчмарков, где новая модель демонстрирует превосходство над конкурентами в задачах программирования и автоматизации.
| Бенчмарк | DeepSeek-V4.1-Flash | DeepSeek-V4-Flash | Opus-5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 90.6 | 82.7 | 89.1 | 88.8 |
| DeepSWE v1.1 | 74.2 | 54.4 | 74.0 | 73.0 |
| Terminal-Bench 4.0 | 31.2 | 7.0 | 51.8 | 39.9 |
| Automation-Bench | 54.8 | 37.7 | 50.3 | 45.8 |
| GPQA Diamond | 90.9 | 89.9 | 93.4 | 94.1 |
| Codeforces (rating) | 3471 | 3289 | n/a | n/a |
Технические инновации: CED, CSA2 и FP4
Архитектура построена на принципе Causal Encoder-Decoder (CED). 40-слойный бэкбон разделен на 20 слоев энкодера и 20 слоев декодера. Декодер не вычисляет глобальный KV-кэш самостоятельно, а проецирует его из скрытого состояния энкодера. Это почти вдвое снижает вычислительную нагрузку при префилле. Для управления скользящим окном внимания (SWA) применяется метод Decoder SWA Bounded Replay, который переигрывает только последние 128 токенов, а не весь контекст.
Для сжатия внимания используется алгоритм Compressed Sparse Attention 2 (CSA2). Каждый слой статически выбирает один из трех режимов:
- Full: вычисляет основной KV и индексатор K, выбирает Top-512 индексов.
- Reindex: переиспользует KV и K от слоя Full, но пересчитывает их через свой индексатор Q.
- Reuse: полностью переиспользует KV, K и Top-K индексы, пропуская индексатор.
Основной KV-кэш квантован до формата FP4 (E2M1) с одним масштабом E4M3 на 16 каналов. Это сокращает объем хранения по сравнению с FP8 в два раза. При этом SWA-кэш не сохраняется на SSD, а живет в распределенном пуле DRAM с TTL в несколько минут, что кардинально меняет экономику развертывания.
Обучение и доступность
Модель предварительно обучена на 45 триллионах мультимодальных токенов (соотношение текст/мультимедиа 7:1). Спартенное внимание обучалось с нуля на длине 64K без плотного разогрева, а контекст расширен до 1M на 34 триллионах токенов. Пост-обучение (post-training) проведено без новых алгоритмов, но за счет масштабного синтеза верифицируемых задач агентов и RL на гетерогенных платформах (Claude Code, Codex, OpenCode и др.).
Весы модели открыты под лицензией MIT и доступны на Hugging Face. Поддерживаются инференс через vLLM, SGLang и Transformers. Также доступна публичная API с тремя уровнями вычислительных мощностей (low, high, max reasoning).
Бенчмарки
| Бенчмарк | DeepSeek-V4.1-Flash | DeepSeek-V4-Flash | GPT-5.6 Sol | Opus-5 |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 90.6% | 82.7% | 88.8% | 89.1% |
| DeepSWE v1.1 | 74.2% | 54.4% | 73% | 74% |
| Terminal-Bench 4.0 | 31.2% | 7% | 39.9% | 51.8% |
| Automation-Bench | 54.8% | 37.7% | 45.8% | 50.3% |
| GPQA Diamond | 90.9% | 89.9% | 94.1% | 93.4% |
| Codeforces (rating) | 3471rating | 3289rating | — | — |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
