LightLLM v1.2.0: RL-сервинг через verl, дисагрегированный ViT, гибридный кэш для линейного внимания и многоуровневая кэшизация.
- Added: Поддержка RL-сервинга: LightLLM стал бэкендом для verl с онлайн-обновлением весов, управлением кэшем и GPU-памятью.
- Added: Дисагрегированный ViT: визуальное кодирование вынесено в отдельный сервис с прокси-режимом и кэшем на AFS/Redis.
- Added: Гибридный Radix Cache: двухуровневая система (большие и малые страницы) для эффективного кэширования моделей с линейным вниманием.
- Added: Многоуровневый кэш и PD: поддержка GPU/CPU/disk, квантованных форматов KV, NUMA-aware размещения и cache-aware планирования.
- Fixed: Исправления: баги FP8 для MoE, загрузка весов Mixtral, предупреждения Triton, оптимизация выделения памяти MTP и стабильность планировщика.