DeepSeek V4.1 Flash: Архитектура и бенчмарк
В выпуске LAI #145 подробно рассмотрена новая модель DeepSeek V4.1 Flash. Ключевое отличие от предыдущей версии V4 Flash — переработанная архитектура, направленная на снижение требований к памяти KV-cache (Key-Value cache). Это критически важно для снижения задержек и стоимости inference при длинных сессиях.
Модель прошла тестирование на собственном бенчмарке Towards AI, оценивающем способность следовать детальным инструкциям и писать образовательные сценарии в заданном стиле. Результаты показали высокую эффективность в задачах на генерацию контента, хотя и выявили определенные узкие места в сложных логических цепочках.
Оптимизация затрат: Prompt Caching
Один из главных инсайтов выпуска касается экономики промптов. Использование prompt caching (кэширования промптов) позволяет сократить затраты на ввод длинных сессий примерно на 85%. Это достигается за счет повторного использования уже вычисленных ключей и значений для неизменяемых частей запроса (системных промптов, контекста), что значительно ускоряет обработку и снижает нагрузку на GPU.
Умная маршрутизация и балансировка нагрузки
Стандартные алгоритмы балансировки нагрузки (load balancing) часто игнорируют размер кэшированных префиксов. В новых системах маршрутизации LLM рекомендуется учитывать не только количество токенов, но и объем сохраненного KV-cache. Это позволяет направлять запросы на серверы с наиболее подходящим состоянием памяти, избегая лишних вычислений и переключений контекста.
Проблема «распыления» бюджета в агентах
При создании AI-агентов с несколькими инструментами поиска (веб, видео, документы) возникает проблема неэффективного использования лимитов. Если каждому инструменту задать отдельный лимит (например, по 5 запросов), агент может сделать 15 вызовов, оставаясь в рамках индивидуальных ограничений, но исчерпав общий бюджет.
Решение: Внедрение единого общего бюджета (shared budget) для всех исследовательских инструментов. Агент видит общий счетчик (например, 6 вызовов) и, понимая, что осталось всего 2 запроса, переключается с широкого поиска на точечный сбор доказательств. Это предотвращает бесконечные итерации и ускоряет переход к этапу генерации ответа.
Снижение требований к памяти: Nemotron
Лаборатория NVIDIA в рамках проекта Nemotron представила гибридную архитектуру, которая эффективно снижает требования к KV-cache. Это решение позволяет обрабатывать более длинные контексты без пропорционального роста потребления памяти, что делает модели более доступными для развертывания на ресурсоемких задачах.
Сообщество: g023codev2
Разработчик g023 представил терминальный код-агент g023codev2, оптимизированный специально для DeepSeek. Архитектура решает проблему перегрузки контекста:
- Тяжелая работа с файлами делегируется субагентам.
- Субагенты возвращают структурную сводку и карту символов к диапазонам строк.
- Основной агент запрашивает исходный код только точечно, когда это необходимо.
- Поддерживаются параллельные команды агентов и переиспользуемые навыки (skills), которые подгружаются по требованию, а не загружаются в системный промпт.
Репозиторий доступен для тестирования и улучшения сообществом.
Источник: Towards AI pub ↗
