llama.cpp 0.4.1: поддержка новых моделей (Maple 20B, Tencent Hy 4), улучшена работа с JSON и сервером, обновлен ggml.
- Added: Добавлена поддержка моделей Maple 20B-A1B, Tencent Hy 4 и Spark2.5.
- Breaking: Удалены устаревшие флаги --mmap, --mlock и --direct-io в пользу --load-mode.
- Added: Улучшена обработка JSON-схем и разделены парсеры чатов для лучшей структуры.
- Fixed: Исправлено распределение KV-кэша для DeepSeek2, GLM-MoE и нормализация GDN.
- Added: Реализован структурированный JSONL-логирование и улучшено управление дочерними процессами сервера.