Релиз модели17 сентября 2026 г., 18:18 МСК🤖 Auto

DeepSeek V4.1 Flash: Тест, оптимизация KV-cache и экономия до 85% на промптах

Разбираем архитектуру DeepSeek V4.1 Flash, результаты бенчмарка написание и новые методы оптимизации затрат через кэширование промптов и шаринг бюджета агентов.

Баннер новости 7721

DeepSeek V4.1 Flash: Архитектура и бенчмарк

В выпуске LAI #145 подробно рассмотрена новая модель DeepSeek V4.1 Flash. Ключевое отличие от предыдущей версии V4 Flash — переработанная архитектура, направленная на снижение требований к памяти KV-cache (Key-Value cache). Это критически важно для снижения задержек и стоимости inference при длинных сессиях.

Модель прошла тестирование на собственном бенчмарке Towards AI, оценивающем способность следовать детальным инструкциям и писать образовательные сценарии в заданном стиле. Результаты показали высокую эффективность в задачах на генерацию контента, хотя и выявили определенные узкие места в сложных логических цепочках.

Оптимизация затрат: Prompt Caching

Один из главных инсайтов выпуска касается экономики промптов. Использование prompt caching (кэширования промптов) позволяет сократить затраты на ввод длинных сессий примерно на 85%. Это достигается за счет повторного использования уже вычисленных ключей и значений для неизменяемых частей запроса (системных промптов, контекста), что значительно ускоряет обработку и снижает нагрузку на GPU.

Умная маршрутизация и балансировка нагрузки

Стандартные алгоритмы балансировки нагрузки (load balancing) часто игнорируют размер кэшированных префиксов. В новых системах маршрутизации LLM рекомендуется учитывать не только количество токенов, но и объем сохраненного KV-cache. Это позволяет направлять запросы на серверы с наиболее подходящим состоянием памяти, избегая лишних вычислений и переключений контекста.

Проблема «распыления» бюджета в агентах

При создании AI-агентов с несколькими инструментами поиска (веб, видео, документы) возникает проблема неэффективного использования лимитов. Если каждому инструменту задать отдельный лимит (например, по 5 запросов), агент может сделать 15 вызовов, оставаясь в рамках индивидуальных ограничений, но исчерпав общий бюджет.

Решение: Внедрение единого общего бюджета (shared budget) для всех исследовательских инструментов. Агент видит общий счетчик (например, 6 вызовов) и, понимая, что осталось всего 2 запроса, переключается с широкого поиска на точечный сбор доказательств. Это предотвращает бесконечные итерации и ускоряет переход к этапу генерации ответа.

Снижение требований к памяти: Nemotron

Лаборатория NVIDIA в рамках проекта Nemotron представила гибридную архитектуру, которая эффективно снижает требования к KV-cache. Это решение позволяет обрабатывать более длинные контексты без пропорционального роста потребления памяти, что делает модели более доступными для развертывания на ресурсоемких задачах.

Сообщество: g023codev2

Разработчик g023 представил терминальный код-агент g023codev2, оптимизированный специально для DeepSeek. Архитектура решает проблему перегрузки контекста:

  • Тяжелая работа с файлами делегируется субагентам.
  • Субагенты возвращают структурную сводку и карту символов к диапазонам строк.
  • Основной агент запрашивает исходный код только точечно, когда это необходимо.
  • Поддерживаются параллельные команды агентов и переиспользуемые навыки (skills), которые подгружаются по требованию, а не загружаются в системный промпт.

Репозиторий доступен для тестирования и улучшения сообществом.

Источник: Towards AI pub ↗