Проблема визуального шума в мир-моделях
Традиционные мир-модели для визуального управления (например, DreamerV3) обучаются реконструировать всё изображение целиком. Это создает фундаментальное противоречие: модель тратит вычислительные ресурсы на кодирование фона и отвлекающих факторов, которые не влияют на принятие решений. В результате латентные представления «разбавляются» нерелевантной информацией, что критически снижает точность управления в сложных условиях.
Решение: TaskSense с дифференцируемым вниманием
Авторы предлагают TaskSense — архитектуру, которая внедряет стохастический механизм пространственного внимания (spatial attention) до этапа кодирования латентного состояния. Ключевые особенности:
- Условное внимание: Карта внимания формируется на основе предыдущего латентного состояния.
- Обратная динамика (Inverse Dynamics): Обучение дополняется вспомогательной задачей, которая заставляет модель фокусироваться на областях, необходимых для предсказания действий.
- Селективная реконструкция: Декодер восстанавливает только те части изображения, на которые указывает карта внимания, игнорируя остальной визуальный мусор.
Результаты: Победа над отвлечениями
Эксперименты показали, что TaskSense не просто сохраняет эффективность на стандартных задачах, но и превосходит базовый DreamerV3 в условиях визуальных помех. Модель научилась «игнорировать» отвлекающие элементы, концентрируясь только на управляемых объектах.
| Метрика / Набор данных | TaskSense | DreamerV3 (Baseline) | Примечание |
|---|---|---|---|
| DeepMind Control Suite | Конкурентоспособная | Базовая | Стандартные задачи без шума |
| Distracting Control Suite | Превосходит | Уступает | Задачи с визуальными помехами |
| Устойчивость к шуму | Высокая | Низкая | Способность игнорировать фон |
Почему это важно
TaskSense демонстрирует, что для эффективного управления роботом или агентом в реальном мире не нужно понимать всё изображение. Достаточно выделять релевантные паттерны. Это открывает путь к созданию более надежных систем автономного управления, способных работать в зашумленных средах без необходимости перепрофилирования огромных объемов вычислительных ресурсов на обработку фона.
Источник: arXiv cs.AI ↗
