Релиз v1.0.0: ускорение inference до 8x, исправление ошибок и улучшение первого запуска модели Kimi K3.
- Added: Внедрены слитые ядра matmul (fp32, bf16, MXFP4), снижающие вычисления на токен примерно в 8 раз.
- Added: Добавлен режим `--preset auto` для автоматического выделения памяти под trunk и expert-cache.
- Added: Реализован chunk-union prefill, сокращающий объем данных экспертов при генерации вдвое.
- Added: Возобновление диалога через `--save-state` / `--load-state` работает в 3.9 раза быстрее.
- Fixed: Исправлены ошибки первого запуска, сломанные скрипты и скрытые пути повреждения данных.