В условиях частичной наблюдаемости (POMDP) агенты обучения с подкреплением (RL) часто действуют вслепую, не имея полной картины окружения. Интеграция языковых моделей (LLM/SLM) для помощи таким агентам казалась перспективной, но стандартные подходы с «воротами неопределенности» (uncertainty-gated) терпели неудачу: малые модели почти никогда не предлагали альтернативных действий, выступая лишь пассивной проверкой. Авторы работы ASK in the Dark выявили корень проблемы: дело не в недостатке вычислительных мощностей модели, а в недостатке контекста в промпте.
От пассивной проверки к активному консультанту
Новый метод ASK+ решает проблему контекста, предоставляя SLM не просто текущее наблюдение, а историю траектории: частично открытую карту, посещенные позиции и историю действий. Это превращает модель из простого фильтра в активного консультанта, способного корректировать политику агента. Ключевым техническим открытием стало подтверждение, что сигнал предсказательной энтропии (predictive entropy) корректно измеряет неопределенность действия, а не состояния, что делает селективный запрос к LLM жизнеспособным даже в сложных POMDP-средах.
Результаты: качество важнее размера модели
Эксперименты показали, что правильный дизайн промпта и селективное управление важнее масштаба модели. Модель Qwen3.5-2B в связке с ASK+ достигла результатов, сопоставимых или превышающих показатели более тяжелой Qwen3.5-4B. Это открывает путь к использованию энергоэффективных малых моделей в критически важных системах без потери качества.
Сравнение эффективности методов на различных тестовых средах:
| Среда (Environment) | Vanilla ASK | ASK+ (предложенный метод) | Примечание |
|---|---|---|---|
| DoorKey | 89% | 93% | Превосходство над базовым PPO (89%) |
| FourRooms | 53% | 70% | Значительный прирост успешности |
| HigherLower | — | 73.7% | Результат равен верхней границе SLM-only |
Работа принята к публикации на совместном семинаре IJCAI-ECAI (Planning for Complex Real-World Applications), что подтверждает значимость подхода для планирования в сложных реальных условиях. Авторы доказывают, что даже скромные по размеру модели могут стать мощным инструментом навигации и принятия решений, если правильно «накормить» их историей и структурированным мышлением (chain-of-thought).
Источник: arXiv cs.AI ↗
