💡
Почему LoRA? Адаптер rank-1 для модели 1.5B весит всего несколько мегабайт. Это позволяет передавать обновления практически мгновенно через файловую систему, в то время как полная модель весит гигабайты, что сделало бы синхронизацию через бакет узким местом.
⚠️
Важно про KV-cache: Никогда не используйте одно и то же имя для адаптера при обновлении. vLLM кэширует KV-блоки по имени адаптера. Если переименовывать файл, кэш может стать невалидным, что приведет к рассинхронизации префилла и декодирования и падению метрики `ratio`.
Источник: Hugging Face ↗
