Проблема разрыва между восприятием и логикой
Традиционные подходы к перцептивному планированию (perceptual planning) страдают от фундаментального недостатка: они преобразуют непрерывные данные визуального восприятия в дискретные символические факты. Этот процесс «жесткого» квантования отбрасывает информацию о неопределенности сцены и разрывает обратную связь между уровнем задачи и уровнем восприятия. В результате роботы часто принимают ошибочные решения из-за потери нюансов в данных сенсоров.
Решение: Fully Differentiable Neuro-Soft-Symbolic Framework
Авторы работы Hongyan Wei и Wael AbdAlmageed предлагают новую архитектуру, которая сохраняет непрерывное «мягкое» символическое состояние (soft symbolic state). Ключевые технические инновации включают:
- Дифференцируемый оператор перехода: доменные правила логики lifted (подняты) в форму дифференцируемого оператора soft-$T_P$.
- Единый граф вычислений: визуальное восприятие и планирование действий оптимизируются совместно.
- Обратное распространение градиентов: ошибки на этапе планирования позволяют обновлять параметры восприятия, заставляя модель фокусироваться на признаках, критичных для выполнения задачи.
Результаты бенчмарков: Blocksworld
Эксперименты проводились на стандартных наборах данных Blocksworld. Новый метод демонстрирует высокую точность решения задач при меньших вычислительных затратах по сравнению с базовыми моделями.
| Метрика / Набор данных | Предложенный метод | LatPlan (базовый) | Reasoning-model baseline |
|---|---|---|---|
| LatPlan-40 (решено из 40) | 40/40 | 33/40 | — |
| PlanBench-600 (решено из 600) | 596/600 | — | 587/600 |
| Успешность при неопределенности (ablation) | 83% | — | 59% (frozen perception) |
Значение для робототехники
Важнейшим аспектом работы является валидация совместимости декодированных планов задач с последующим выполнением движений (task-and-motion simulations). Это доказывает, что абстрактные логические планы, сгенерированные нейросетью, могут быть напрямую переведены в физические действия робота без потери целостности, что открывает путь к созданию более адаптивных автономных систем.
Источник: arXiv cs.AI ↗
