Oumi v0.9: полный цикл обучения агентов с инструментами, RL через verl, синтез диалогов и запуск на Modal/Slurm.
- Added: Обучение моделей вызову инструментов (SFT, DPO) и поддержка новых шаблонов чата.
- Added: Выполнение инструментов в реальных средах: базы данных, HTTP, симуляции и детерминированные запросы.
- Added: Интеграция verl для RL (GRPO) поверх любых сред Oumi с поддержкой пользовательских наград.
- Added: Синтез многошаговых диалогов с инструментами и оценка ответов через RubricJudge.
- Added: Запуск задач через Modal GPU и SkyPilot-routed Slurm, а также отказоустойчивые пайплайны.