Глубокие агенты и длинные сессии превратили обслуживание LLM в узкое место, где HBM и пропускная способность памяти становятся критическими. DeepSeek AI ответила на это выпуском DeepSeek-V4.1-Flash — мультимодальной MoE-модели с 552B базовых параметров и 196B дополнительных параметров Engram. Главная инновация: глобальный размер KV-кэша составляет всего 890 байт на токен, что в 4 раза меньше V4-Flash и в 437 раз меньше оригинального V1. Модель поддерживает контекстное окно в 1 миллион токенов и доступна под лицензией MIT.
01Архитектура: Causal Encoder-Decoder и CSA2
Модель использует 40-слойный бэкбон, разделенный на 20 слоев каузального энкодера и 20 слоев декодера. Эта архитектура, вдохновленная YOCO, позволяет декодеру не вычислять собственный глобальный KV-кэш, а проецировать его из финального скрытого состояния энкодера. Это почти вдвое снижает вычислительную нагрузку на этапе префилла (prefill).
Для оптимизации внимания применяется Compressed Sparse Attention 2 (CSA2). Каждый слой CSA2 статически назначается в один из трех режимов:
- Full: вычисляет основной KV и индексатор K, выбирает свежие Top-512 индексы.
- Reindex: переиспользует основной KV и индексатор K от предыдущего Full-слоя, но пересчитывает их с помощью своего индексатора Q.
- Reuse: переиспользует основной KV и последние Top-K индексы, полностью пропуская индексатор.
В энкодере (18 слоев CSA2) используется соотношение сжатия 2:3 (1 Full, 5 Reuse). В декодере (20 слоев) соотношение 1:5 (1 Full + 3 Reuse, затем Reindex + 3 Reuse). Иерархический индексатор в декодере позволяет Full-слою строить пул кандидатов до 16 384 позиций, ограничивая объем данных для последующих слоев.
02Технические детали: FP4, Engram и DSpark
Основной KV-кэш квантован до формата E2M1 (FP4) с одним масштабом E4M3 на каждые 16 каналов. Это реализовано через обучение с учетом квантования (QAT) на этапе пост-обработки и сокращает объем хранения почти вдвое по сравнению с FP8 в V4. Кэш скользящего окна (SWA) больше не сохраняется на SSD; он живет в распределенном пуле, занимающем 10% DRAM хоста, с TTL в несколько минут. При промахе (miss) происходит пересчет только 128 токенов, а не всех слоев.
Дополнительные оптимизации включают:
- Single-Pass mHC: сдвиг коэффициентов смешивания входных данных для уменьшения трафика активаций.
- Engram: условный модуль памяти на слоях 1 и 14.
- DSpark: спекулятивное декодирование, обученное после предобучения при замороченном бэкбоне.
03Бенчмарки и производительность
Предобучение прошло на 45 трлн мультимодальных токенов (соотношение текст/мультимедиа 7:1). Модель активирует 8B параметров на токен при префилле и 16B при декодировании. Ниже приведены результаты сравнения с ключевыми конкурентами:
| Benchmark | DS-V4.1-Flash | DS-V4-Flash | Opus-5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 90.6 | 82.7 | 89.1 | 88.8 |
| DeepSWE v1.1 | 74.2 | 54.4 | 74.0 | 73.0 |
| Terminal-Bench 4.0 | 31.2 | 7.0 | 51.8 | 39.9 |
| Automation-Bench | 54.8 | 37.7 | 50.3 | 45.8 |
| GPQA Diamond | 90.9 | 89.9 | 93.4 | 94.1 |
| Codeforces (rating) | 3471 | 3289 | n/a | n/a |
DeepSeek-V4.1-Flash превосходит Opus-5 и GPT-5.6 Sol в задачах Terminal-Bench 2.1 и DeepSWE v1.1, демонстрируя высокую эффективность в агентных сценариях.
04Установка и запуск
Модель доступна на Hugging Face с открытыми весами. Для локального деплоя рекомендуется использовать vLLM или SGLang, так как они лучше всего поддерживают специфические оптимизации CSA2 и FP4 кэша.
Пример установки зависимостей и загрузки модели через Transformers:
pip install transformers accelerate vllmПример кода для инициализации модели (псевдокод на основе стандартных паттернов для MoE):
from transformers import AutoModelForCausalLM, AutoTokenizer
model_name = "deepseek-ai/DeepSeek-V4.1-Flash"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(
model_name,
torch_dtype="auto",
device_map="auto"
)
# Пример генерации с длинным контекстом
input_text = "..." # Ваш длинный промпт до 1M токенов
inputs = tokenizer(input_text, return_tensors="pt").to(model.device)
outputs = model.generate(
**inputs,
max_new_tokens=1024,
use_cache=True,
fp4_kv_cache=True # Флаг зависит от реализации в vLLM/SGLang
)05Кому подойдёт / что запустится
DeepSeek-V4.1-Flash идеален для:
- Агентных систем: Высокие баллы в DeepSWE и Terminal-Bench делают её лучшим выбором для автономного программирования и работы с терминалом.
- Длинных документов: Поддержка 1M токенов с низким потреблением памяти позволяет анализировать огромные базы знаний без выгрузки на диск.
- Локальных развертываний: Лицензия MIT и открытые веса позволяют интегрировать модель в корпоративные контуры без ограничений API.
Для запуска потребуется инфраструктура с высокой пропускной способностью памяти (HBM3e/HBM3) и поддержка FP4 в аппаратном обеспечении или через софтверные оптимизации в vLLM/SGLang. Модель превосходит многие закрытые аналоги в специфических задачах, уступая лишь в общих знаниях (GPQA) флагманским моделям GPT-5.6 и Opus-5.
Источник: MarkTechPost ↗
