Поддержка обучения на 1M+ токенов, оптимизация производительности через использование тензорных ядер и перенос потерь из Liger-Kernel.
- Added: Добавлена поддержка обучения на последовательностях длиной более 1 млн токенов с подробным руководством и примерами.
- Added: Проекция lm_head для chunked-CE теперь выполняется на тензорных ядрах, что значительно ускоряет обучение и снижает потребление памяти.
- Added: Встроенные модули потерь (DPO, KTO, GRPO, JSD) перенесены из Liger-Kernel в trl.losses для обеспечения стабильности и совместимости.
- Added: QLoRA теперь конфигурируется через аргумент quantization_config, что упрощает настройку квантования.
- Added: Документация разделена на стабильные и экспериментальные трейнеры, добавлены инструкции по изменению целевой функции обучения.