Исследования21 августа 2026 г., 10:17 МСК🤖 Auto

QDOS: Офлайн-обучение навыков через Quality-Diversity для роботов

Исследователи представили QDOS — метод извлечения высококачественных навыков из офлайн-данных с помощью Quality-Diversity RL, превосходящий базовые подходы в задачах манипуляции и локомоции.

Баннер новости 6219

Проблема качества офлайн-данных

Использование предварительно собранных наборов данных (offline RL) позволяет повысить эффективность обучения политик, однако стандартные подходы часто опираются на методы обучения без учителя, такие как траекторные VAE. Главный недостаток таких систем — качество извлекаемых низкоуровневых навыков критически зависит от качества исходного датасета. Если данные содержат мало полезной информации, политика не может эффективно научиться решать задачи.

Решение: QDOS и Advantage-Weighted Objective

Авторы (Tanachai Anakewat, Takayuki Osa, Tatsuya Harada) предлагают метод QDOS (Quality-Diversity Offline Skill learning). Ключевое нововведение — использование Advantage-Weighted Quality-Diversity pretraining objective. Этот подход взвешивает цели извлечения навыков и их разнообразия на основе оцененного преимущества (advantage) каждого сегмента траектории. Это позволяет модели отбирать не просто разнообразные, но и высокоценные действия, формируя более надежное пространство навыков.

Двойное использование данных (Dual Dataset Reuse)

QDOS интегрирует стратегию двойного использования данных:

  • Предобучение: Офлайн-данные используются для извлечения навыков.
  • Онлайн-буфер: Те же данные пополняют онлайн-буфер воспроизведения (replay buffer) через псевдо-маркировку (pseudo-labeling), что ускоряет исследование среды (exploration) в сложных доменах с разреженными наградами.

Результаты и сравнение

Эксперименты подтверждают, что QDOS значительно превосходит сильные базовые модели как в структурированных задачах манипуляции, так и в неструктурированных задачах локомоции. Метод демонстрирует способность ускорять исследование и повышать итоговые показатели (returns) в сложных условиях.

Характеристика Стандартный подход (VAE-based) QDOS (Предложенный метод)
База извлечения навыков Независимое обучение (Unsupervised) Advantage-Weighted Quality-Diversity
Зависимость от качества датасета Высокая (качество навыков = качество данных) Сниженная (фильтрация по ценности траекторий)
Использование офлайн-данных Только для предобучения Предобучение + пополнение онлайн-буфера
Применимость Ограничена простыми средами Сложные задачи с разреженными наградами

Значение для индустрии

Работа, принятая к публикации в IROS 2026, закрывает важный пробел в робототехнике и AI. Способность извлекать качественные навыки из «грязных» или неоптимальных исторических данных позволяет быстрее обучать роботов новым действиям без необходимости сбора миллионов новых примеров, что критически важно для коммерческого внедрения автономных систем.

Источник: arXiv cs.AI ↗