Исследования3 июля 2026 г., 17:16 МСК🤖 Auto

OPINE-World: LLM-агент, решающий ARC-AGI-3 без дообучения

Исследователи представили OPINE-World — систему, использующую LLM для создания программных моделей мира. Агент решает 20 из 25 задач ARC-AGI-3 с первого раза, демонстрируя эффективность, близкую к человеческой.

Баннер новости 2856

Проблема данных и гибкость

Глубокие нейросети, используемые для создания моделей мира (world models), требуют огромных объемов данных и плохо переносят знания в новые условия. Альтернативный подход — программная синтез моделей через LLM и индуктивный синтез, управляемый контрпримерами (CEGIS), — экономит данные, но ранее применялся только к структурированным мирам с фиксированным набором объектов. OPINE-World решает проблему гибкого гипотезирования структуры объектов в пиксельных средах.

Архитектура: два агента в цикле

Система OPINE-World состоит из двух взаимодействующих агентов, работающих в цикле «гипотеза — тест»:

  • Агент-эксплорер: действует в среде, собирая данные.
  • Агент-синтезатор: пишет программный код модели мира, используя LLM, и проверяет его через replay-верификацию и планирование на основе модели.

Ключевая инновация — использование меры «онтологической ошибки» (ontology error) на основе байесовского вывода. Эта метрика направляет исследование среды, помогая агенту определять, какие типы объектов он еще не понял, и фокусировать поиск на их выявлении.

Результаты на ARC-AGI-3

Оценка проводилась на бенчмарке ARC-AGI-3, где объектный словарь, цель и семантика действий скрыты от агента. Это требует способности к быстрому обучению навыкам (skill-acquisition efficiency). OPINE-World не проходит дообучение для каждой игры отдельно.

Метрика Результат OPINE-World Примечание
Решенные задачи 20 из 25 Без per-game training
Эффективность действий 78.4 Сравнимо с человеческим базовым уровнем

Значение для индустрии

Результат демонстрирует, что LLM-агенты могут эффективно формировать абстрактные представления о среде «на лету», не полагаясь на предварительно обученные веса для конкретных доменов. Это шаг к созданию универсальных агентов, способных адаптироваться к совершенно новым задачам с минимальным количеством взаимодействий.

Источник: arXiv cs.AI ↗