Суть обновления: Пост-обучение, а не новая архитектура
31 июля 2026 года DeepSeek официально выпустила модель DeepSeek-V4-Flash-0731 на Hugging Face и перевела соответствующий API в публичную бету. Ключевой момент: архитектура и размер модели остались прежними по сравнению с апрельским превью. Прирост производительности достигнут исключительно за счет re-post-training (дообучения после базового обучения), а не изменения структуры.
Модель базируется на MoE-архитектуре с 284 млрд параметров, из которых активны 13 млрд на токен. В чекпоинт интегрирован модуль спекулятивного декодирования DSpark, что увеличивает общее число параметров в репозитории до 304B (284B база + 20B черновик).
Бенчмарки: V4-Flash бьет V4-Pro в агентах
DeepSeek сообщает, что новая версия превосходит V4-Pro (Preview) во всех опубликованных агентных тестах. Это критически важно для разработчиков AI-агентов, которым нужна надежность и скорость. Ниже приведены сравнительные данные по ключевым метрикам:
| Бенчмарк | V4-Flash-0731 | V4-Pro (Preview) | GLM-5.2 | Opus-4.8 |
|---|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 72.1 | 81.0 | 85.0 |
| NL2Repo | 54.2 | 38.5 | 48.9 | 69.7 |
| DeepSWE | 54.4 | 12.8 | 46.2 | 58.0 |
| Toolathlon-Verified | 70.3 | 55.9 | 59.9 | 76.2 |
| Agents’ Last Exam | 25.2 | 16.5 | 23.8 | 25.7 |
Примечание: Данные основаны на внутреннем инструменте DeepSeek Harness. Независимые запуски могут отличаться.
Экономика: API vs Self-hosting
Модель предлагает два пути развертывания с радикально разными требованиями к инфраструктуре:
- Через API: Идеально для стартапов и инди-разработчиков. Цена составляет $0.14 за 1M входных токенов (при cache miss) и $0.28 за выходные. Это примерно в 3 раза дешевле, чем V4-Pro ($0.87 за выходные токены). Лимит параллельных запросов — 2,500.
- Self-hosting: Требует серьезных ресурсов. Для работы в полном разрешении нужен сервер с 4x GB300. При квантовании (3-bit) модель занимает ~103 GB VRAM/RAM, а 8-bit версия — 162 GB. Лицензия MIT позволяет коммерческое использование без ограничений.
Технические детали и запуск
Для активации ускорения через DSpark в vLLM используется флаг:
--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'
DeepSeek заявляет, что это обеспечивает ускорение генерации на 60–85% по сравнению с базовым MTP-1. Для агентов рекомендуется использовать reasoning_effort в режимах high или max с температурой 1.0 и top_p 0.95. Шаблон чата Jinja не используется; вместо него поставляются функции encode_messages и parse_message_from_completion_text.
Бенчмарки
| Бенчмарк | DeepSeek-V4-Flash-0731 | GLM-5.2 | V4-Flash (Preview) | V4-Pro (Preview) |
|---|---|---|---|---|
| Terminal Bench 2.1 | 82.7% | 81% | 61.8% | 72.1% |
| NL2Repo | 54.2% | 48.9% | 39.4% | 38.5% |
| Cybergym | 76.7% | 83.1% | 38.7% | 52.7% |
| DeepSWE | 54.4% | 46.2% | 7.3% | 12.8% |
| Toolathlon-Verified | 70.3% | 59.9% | 49.7% | 55.9% |
| Agents’ Last Exam | 25.2% | 23.8% | 15.8% | 16.5% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
