Релиз v0.3.0-pre: запуск асинхронного Unified Trainer, поддержка On-Policy Distillation, интеграция Verifiers и новые CLI-команды.
- Added: Полностью асинхронный Unified Trainer с поддержкой предвычисленных преимуществ и новых методов оценки (REINFORCE++, RLOO).
- Added: Добавлена поддержка On-Policy Distillation (OPD) и примеры обучения с использованием VLM.
- Deprecated: Бэкенд Tinker перенесен в rllm.trainer.tinker; старые API в rllm.trainer.deprecated помечены как устаревшие.
- Added: Новые CLI-команды: rllm login для аутентификации UI и улучшенный UILogger с фоновым потоком.
- Added: Интеграция Verifiers, Prime Intellect Environment и добавление примера Geo3K Tinker.
- Fixed: Исправлены ошибки в вычислении преимуществ, парсере Qwen и работе с Fireworks API.