Проблема данных и гибкость
Глубокие нейросети, используемые для создания моделей мира (world models), требуют огромных объемов данных и плохо переносят знания в новые условия. Альтернативный подход — программная синтез моделей через LLM и индуктивный синтез, управляемый контрпримерами (CEGIS), — экономит данные, но ранее применялся только к структурированным мирам с фиксированным набором объектов. OPINE-World решает проблему гибкого гипотезирования структуры объектов в пиксельных средах.
Архитектура: два агента в цикле
Система OPINE-World состоит из двух взаимодействующих агентов, работающих в цикле «гипотеза — тест»:
- Агент-эксплорер: действует в среде, собирая данные.
- Агент-синтезатор: пишет программный код модели мира, используя LLM, и проверяет его через replay-верификацию и планирование на основе модели.
Ключевая инновация — использование меры «онтологической ошибки» (ontology error) на основе байесовского вывода. Эта метрика направляет исследование среды, помогая агенту определять, какие типы объектов он еще не понял, и фокусировать поиск на их выявлении.
Результаты на ARC-AGI-3
Оценка проводилась на бенчмарке ARC-AGI-3, где объектный словарь, цель и семантика действий скрыты от агента. Это требует способности к быстрому обучению навыкам (skill-acquisition efficiency). OPINE-World не проходит дообучение для каждой игры отдельно.
| Метрика | Результат OPINE-World | Примечание |
|---|---|---|
| Решенные задачи | 20 из 25 | Без per-game training |
| Эффективность действий | 78.4 | Сравнимо с человеческим базовым уровнем |
Значение для индустрии
Результат демонстрирует, что LLM-агенты могут эффективно формировать абстрактные представления о среде «на лету», не полагаясь на предварительно обученные веса для конкретных доменов. Это шаг к созданию универсальных агентов, способных адаптироваться к совершенно новым задачам с минимальным количеством взаимодействий.
Источник: arXiv cs.AI ↗
