Релиз модели1 августа 2026 г., 01:16 МСК🤖 Auto

DeepSeek V4-Flash: Агрессивное обновление для агентов и кода

DeepSeek выпустила официальную версию V4-Flash-0731 с улучшенными агентными и кодовыми навыками. Модель обходит V4-Pro в бенчмарках при цене в 3 раза ниже.

Баннер новости 4845

Суть обновления: Пост-обучение, а не новая архитектура

31 июля 2026 года DeepSeek официально выпустила модель DeepSeek-V4-Flash-0731 на Hugging Face и перевела соответствующий API в публичную бету. Ключевой момент: архитектура и размер модели остались прежними по сравнению с апрельским превью. Прирост производительности достигнут исключительно за счет re-post-training (дообучения после базового обучения), а не изменения структуры.

Модель базируется на MoE-архитектуре с 284 млрд параметров, из которых активны 13 млрд на токен. В чекпоинт интегрирован модуль спекулятивного декодирования DSpark, что увеличивает общее число параметров в репозитории до 304B (284B база + 20B черновик).

Бенчмарки: V4-Flash бьет V4-Pro в агентах

DeepSeek сообщает, что новая версия превосходит V4-Pro (Preview) во всех опубликованных агентных тестах. Это критически важно для разработчиков AI-агентов, которым нужна надежность и скорость. Ниже приведены сравнительные данные по ключевым метрикам:

Бенчмарк V4-Flash-0731 V4-Pro (Preview) GLM-5.2 Opus-4.8
Terminal Bench 2.1 82.7 72.1 81.0 85.0
NL2Repo 54.2 38.5 48.9 69.7
DeepSWE 54.4 12.8 46.2 58.0
Toolathlon-Verified 70.3 55.9 59.9 76.2
Agents’ Last Exam 25.2 16.5 23.8 25.7

Примечание: Данные основаны на внутреннем инструменте DeepSeek Harness. Независимые запуски могут отличаться.

Экономика: API vs Self-hosting

Модель предлагает два пути развертывания с радикально разными требованиями к инфраструктуре:

  • Через API: Идеально для стартапов и инди-разработчиков. Цена составляет $0.14 за 1M входных токенов (при cache miss) и $0.28 за выходные. Это примерно в 3 раза дешевле, чем V4-Pro ($0.87 за выходные токены). Лимит параллельных запросов — 2,500.
  • Self-hosting: Требует серьезных ресурсов. Для работы в полном разрешении нужен сервер с 4x GB300. При квантовании (3-bit) модель занимает ~103 GB VRAM/RAM, а 8-bit версия — 162 GB. Лицензия MIT позволяет коммерческое использование без ограничений.

Технические детали и запуск

Для активации ускорения через DSpark в vLLM используется флаг:

--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'

DeepSeek заявляет, что это обеспечивает ускорение генерации на 60–85% по сравнению с базовым MTP-1. Для агентов рекомендуется использовать reasoning_effort в режимах high или max с температурой 1.0 и top_p 0.95. Шаблон чата Jinja не используется; вместо него поставляются функции encode_messages и parse_message_from_completion_text.

Бенчмарки

БенчмаркDeepSeek-V4-Flash-0731GLM-5.2V4-Flash (Preview)V4-Pro (Preview)
Terminal Bench 2.182.7%81%61.8%72.1%
NL2Repo54.2%48.9%39.4%38.5%
Cybergym76.7%83.1%38.7%52.7%
DeepSWE54.4%46.2%7.3%12.8%
Toolathlon-Verified70.3%59.9%49.7%55.9%
Agents’ Last Exam25.2%23.8%15.8%16.5%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: MarkTechPost ↗