Исследования10 августа 2026 г., 10:16 МСК🤖 Auto

TaskSense: Как мир-модели учатся игнорировать шум

Исследователи представили TaskSense — фреймворк, который заставляет мир-модели фокусироваться только на важных для управления объектах, отбрасывая визуальный шум.

Баннер новости 5412

Проблема визуального шума в мир-моделях

Традиционные мир-модели для визуального управления (например, DreamerV3) обучаются реконструировать всё изображение целиком. Это создает фундаментальное противоречие: модель тратит вычислительные ресурсы на кодирование фона и отвлекающих факторов, которые не влияют на принятие решений. В результате латентные представления «разбавляются» нерелевантной информацией, что критически снижает точность управления в сложных условиях.

Решение: TaskSense с дифференцируемым вниманием

Авторы предлагают TaskSense — архитектуру, которая внедряет стохастический механизм пространственного внимания (spatial attention) до этапа кодирования латентного состояния. Ключевые особенности:

  • Условное внимание: Карта внимания формируется на основе предыдущего латентного состояния.
  • Обратная динамика (Inverse Dynamics): Обучение дополняется вспомогательной задачей, которая заставляет модель фокусироваться на областях, необходимых для предсказания действий.
  • Селективная реконструкция: Декодер восстанавливает только те части изображения, на которые указывает карта внимания, игнорируя остальной визуальный мусор.

Результаты: Победа над отвлечениями

Эксперименты показали, что TaskSense не просто сохраняет эффективность на стандартных задачах, но и превосходит базовый DreamerV3 в условиях визуальных помех. Модель научилась «игнорировать» отвлекающие элементы, концентрируясь только на управляемых объектах.

Метрика / Набор данных TaskSense DreamerV3 (Baseline) Примечание
DeepMind Control Suite Конкурентоспособная Базовая Стандартные задачи без шума
Distracting Control Suite Превосходит Уступает Задачи с визуальными помехами
Устойчивость к шуму Высокая Низкая Способность игнорировать фон

Почему это важно

TaskSense демонстрирует, что для эффективного управления роботом или агентом в реальном мире не нужно понимать всё изображение. Достаточно выделять релевантные паттерны. Это открывает путь к созданию более надежных систем автономного управления, способных работать в зашумленных средах без необходимости перепрофилирования огромных объемов вычислительных ресурсов на обработку фона.

Источник: arXiv cs.AI ↗