Исследования24 августа 2026 г., 09:22 МСК🤖 Auto

Мир моделирует мир: новая теория ε-машин для RL

Исследователи из Университета Аризоны и других институтов предложили строгую математическую классификацию world models, разделяя их на модели среды, агента и их совместной системы через призму вычислительной механики.

Баннер новости 6364

Проблема неопределенности в World Models

В основе современных подходов к обучению с подкреплением (RL) лежит концепция World Models — внутренних представлений среды, которые агент использует для прогнозирования. Однако в литературе отсутствует четкое разделение того, что именно моделирует алгоритм: только внешнюю среду, только собственную политику агента или их неразрывную связку. Авторы работы arXiv:2608.20401 (Manuel Baltieri, Filippo Torresan, Yivan Zhang, Alexander Boyd, Fernando E. Rosas) утверждают, что это различие критически важно для понимания сложности и эффективности обучения.

Три канала моделирования

Используя аппарат вычислительной механики (Computational Mechanics), исследователи определяют канонические предиктивные модели как ε-машины (epsilon-machines). Они выделяют три фундаментальных типа каналов:

  • Канал среды ($O_{:} \mid A_{:}$): Прогноз наблюдений на основе действий. Это стандартный подход, восстанавливающий представления состояния.
  • Канал агента ($A_{:} \mid O_{:}$): Прогноз действий агента на основе наблюдений. Позволяет моделировать поведение и намерения.
  • Совместная система ($(A, O)_{:}$): Модель, рассматриваемая как процесс без входных сигналов, описывающий реализованную траекторию взаимодействия.

Ключевое открытие: Ограничение поддержки (Support Restriction)

Главный структурный результат исследования заключается в том, что канонические модели среды, ограниченные поддержкой (то есть учитывающие только те состояния, которые реально достижимы в паре с данным агентом), факторизуются через канонические каузальные состояния совместной системы. Это означает, что сложность модели можно радикально снизить, если учитывать только те аспекты среды, которые влияют на конкретного агента.

Авторы приводят пример задачи POMDP (Partially Observable Markov Decision Process), где:

  • Неограниченная модель среды имеет бесконечное число состояний.
  • Каноническая модель, индуцированная связкой с агентом, является конечной.

Значение для индустрии

Эта работа предлагает новый теоретический фундамент для проектирования агентов. Понимание того, что «мир» для агента — это не объективная реальность, а проекция совместной динамики, позволяет создавать более эффективные алгоритмы планирования. Разделение на каналы среды и агента открывает путь к созданию систем, которые могут не только предсказывать мир, но и понимать собственные ограничения и стратегии, что критично для безопасного и надежного автономного ИИ.

Источник: arXiv cs.AI ↗