Проблема качества офлайн-данных
Использование предварительно собранных наборов данных (offline RL) позволяет повысить эффективность обучения политик, однако стандартные подходы часто опираются на методы обучения без учителя, такие как траекторные VAE. Главный недостаток таких систем — качество извлекаемых низкоуровневых навыков критически зависит от качества исходного датасета. Если данные содержат мало полезной информации, политика не может эффективно научиться решать задачи.
Решение: QDOS и Advantage-Weighted Objective
Авторы (Tanachai Anakewat, Takayuki Osa, Tatsuya Harada) предлагают метод QDOS (Quality-Diversity Offline Skill learning). Ключевое нововведение — использование Advantage-Weighted Quality-Diversity pretraining objective. Этот подход взвешивает цели извлечения навыков и их разнообразия на основе оцененного преимущества (advantage) каждого сегмента траектории. Это позволяет модели отбирать не просто разнообразные, но и высокоценные действия, формируя более надежное пространство навыков.
Двойное использование данных (Dual Dataset Reuse)
QDOS интегрирует стратегию двойного использования данных:
- Предобучение: Офлайн-данные используются для извлечения навыков.
- Онлайн-буфер: Те же данные пополняют онлайн-буфер воспроизведения (replay buffer) через псевдо-маркировку (pseudo-labeling), что ускоряет исследование среды (exploration) в сложных доменах с разреженными наградами.
Результаты и сравнение
Эксперименты подтверждают, что QDOS значительно превосходит сильные базовые модели как в структурированных задачах манипуляции, так и в неструктурированных задачах локомоции. Метод демонстрирует способность ускорять исследование и повышать итоговые показатели (returns) в сложных условиях.
| Характеристика | Стандартный подход (VAE-based) | QDOS (Предложенный метод) |
|---|---|---|
| База извлечения навыков | Независимое обучение (Unsupervised) | Advantage-Weighted Quality-Diversity |
| Зависимость от качества датасета | Высокая (качество навыков = качество данных) | Сниженная (фильтрация по ценности траекторий) |
| Использование офлайн-данных | Только для предобучения | Предобучение + пополнение онлайн-буфера |
| Применимость | Ограничена простыми средами | Сложные задачи с разреженными наградами |
Значение для индустрии
Работа, принятая к публикации в IROS 2026, закрывает важный пробел в робототехнике и AI. Способность извлекать качественные навыки из «грязных» или неоптимальных исторических данных позволяет быстрее обучать роботов новым действиям без необходимости сбора миллионов новых примеров, что критически важно для коммерческого внедрения автономных систем.
Источник: arXiv cs.AI ↗
