Главная/Блог/Обзор/DeepSeek-V4.1-Flash: 1M контекст и FP4…
Обзор4 мин чтения · 11 сентября 2026 г.

DeepSeek-V4.1-Flash: 1M контекст и FP4 кэш для локального деплоя

DeepSeek выпустил V4.1-Flash: 552B параметров, 1M контекст, FP4 KV-кэш и кросс-слойное переиспользование. Разбор архитектуры, бенчмарков и условий запуска на локальном железе.

DeepSeek-V4.1-Flash: 1M контекст и FP4 кэш для локального деплоя

Глубокие агенты и длинные сессии превратили обслуживание LLM в узкое место, где HBM и пропускная способность памяти становятся критическими. DeepSeek AI ответила на это выпуском DeepSeek-V4.1-Flash — мультимодальной MoE-модели с 552B базовых параметров и 196B дополнительных параметров Engram. Главная инновация: глобальный размер KV-кэша составляет всего 890 байт на токен, что в 4 раза меньше V4-Flash и в 437 раз меньше оригинального V1. Модель поддерживает контекстное окно в 1 миллион токенов и доступна под лицензией MIT.

01Архитектура: Causal Encoder-Decoder и CSA2

Модель использует 40-слойный бэкбон, разделенный на 20 слоев каузального энкодера и 20 слоев декодера. Эта архитектура, вдохновленная YOCO, позволяет декодеру не вычислять собственный глобальный KV-кэш, а проецировать его из финального скрытого состояния энкодера. Это почти вдвое снижает вычислительную нагрузку на этапе префилла (prefill).

Для оптимизации внимания применяется Compressed Sparse Attention 2 (CSA2). Каждый слой CSA2 статически назначается в один из трех режимов:

  • Full: вычисляет основной KV и индексатор K, выбирает свежие Top-512 индексы.
  • Reindex: переиспользует основной KV и индексатор K от предыдущего Full-слоя, но пересчитывает их с помощью своего индексатора Q.
  • Reuse: переиспользует основной KV и последние Top-K индексы, полностью пропуская индексатор.

В энкодере (18 слоев CSA2) используется соотношение сжатия 2:3 (1 Full, 5 Reuse). В декодере (20 слоев) соотношение 1:5 (1 Full + 3 Reuse, затем Reindex + 3 Reuse). Иерархический индексатор в декодере позволяет Full-слою строить пул кандидатов до 16 384 позиций, ограничивая объем данных для последующих слоев.

💡
Ключевая оптимизация. Глобальный KV-кэш сжат до 890 байт/токен за счет FP4-квантования и CSA2. Это делает возможным работу с 1M контекстом на потребительских и серверных GPU с ограниченным HBM.

02Технические детали: FP4, Engram и DSpark

Основной KV-кэш квантован до формата E2M1 (FP4) с одним масштабом E4M3 на каждые 16 каналов. Это реализовано через обучение с учетом квантования (QAT) на этапе пост-обработки и сокращает объем хранения почти вдвое по сравнению с FP8 в V4. Кэш скользящего окна (SWA) больше не сохраняется на SSD; он живет в распределенном пуле, занимающем 10% DRAM хоста, с TTL в несколько минут. При промахе (miss) происходит пересчет только 128 токенов, а не всех слоев.

Дополнительные оптимизации включают:

  • Single-Pass mHC: сдвиг коэффициентов смешивания входных данных для уменьшения трафика активаций.
  • Engram: условный модуль памяти на слоях 1 и 14.
  • DSpark: спекулятивное декодирование, обученное после предобучения при замороченном бэкбоне.

03Бенчмарки и производительность

Предобучение прошло на 45 трлн мультимодальных токенов (соотношение текст/мультимедиа 7:1). Модель активирует 8B параметров на токен при префилле и 16B при декодировании. Ниже приведены результаты сравнения с ключевыми конкурентами:

Benchmark DS-V4.1-Flash DS-V4-Flash Opus-5 GPT-5.6 Sol
Terminal-Bench 2.1 90.6 82.7 89.1 88.8
DeepSWE v1.1 74.2 54.4 74.0 73.0
Terminal-Bench 4.0 31.2 7.0 51.8 39.9
Automation-Bench 54.8 37.7 50.3 45.8
GPQA Diamond 90.9 89.9 93.4 94.1
Codeforces (rating) 3471 3289 n/a n/a

DeepSeek-V4.1-Flash превосходит Opus-5 и GPT-5.6 Sol в задачах Terminal-Bench 2.1 и DeepSWE v1.1, демонстрируя высокую эффективность в агентных сценариях.

04Установка и запуск

Модель доступна на Hugging Face с открытыми весами. Для локального деплоя рекомендуется использовать vLLM или SGLang, так как они лучше всего поддерживают специфические оптимизации CSA2 и FP4 кэша.

Пример установки зависимостей и загрузки модели через Transformers:

terminalbash
pip install transformers accelerate vllm

Пример кода для инициализации модели (псевдокод на основе стандартных паттернов для MoE):

terminalpython
from transformers import AutoModelForCausalLM, AutoTokenizer

model_name = "deepseek-ai/DeepSeek-V4.1-Flash"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(
    model_name,
    torch_dtype="auto",
    device_map="auto"
)

# Пример генерации с длинным контекстом
input_text = "..." # Ваш длинный промпт до 1M токенов
inputs = tokenizer(input_text, return_tensors="pt").to(model.device)

outputs = model.generate(
    **inputs,
    max_new_tokens=1024,
    use_cache=True,
    fp4_kv_cache=True  # Флаг зависит от реализации в vLLM/SGLang
)
⚠️
Важно про VRAM. Несмотря на сжатие, 552B параметров требуют значительной памяти. Для комфортного запуска с 1M контекста рекомендуется использовать мульти-GPU конфигурацию (например, 8x H100/H800 или 4x A100 80GB) с поддержкой FP4 квантования в движке (vLLM/SGLang).

05Кому подойдёт / что запустится

DeepSeek-V4.1-Flash идеален для:

  • Агентных систем: Высокие баллы в DeepSWE и Terminal-Bench делают её лучшим выбором для автономного программирования и работы с терминалом.
  • Длинных документов: Поддержка 1M токенов с низким потреблением памяти позволяет анализировать огромные базы знаний без выгрузки на диск.
  • Локальных развертываний: Лицензия MIT и открытые веса позволяют интегрировать модель в корпоративные контуры без ограничений API.

Для запуска потребуется инфраструктура с высокой пропускной способностью памяти (HBM3e/HBM3) и поддержка FP4 в аппаратном обеспечении или через софтверные оптимизации в vLLM/SGLang. Модель превосходит многие закрытые аналоги в специфических задачах, уступая лишь в общих знаниях (GPQA) флагманским моделям GPT-5.6 и Opus-5.

Источник: MarkTechPost ↗