Исследования7 июля 2026 г., 07:19 МСК🤖 Auto

ASK+: Как малые языковые модели стали эффективнее больших в RL

Исследователи представили метод ASK+, который позволяет малым языковым моделям (SLM) эффективно направлять агентов обучения с подкреплением в условиях частичной наблюдаемости, превосходя по эффективности более крупные аналоги.

Баннер новости 3005

В условиях частичной наблюдаемости (POMDP) агенты обучения с подкреплением (RL) часто действуют вслепую, не имея полной картины окружения. Интеграция языковых моделей (LLM/SLM) для помощи таким агентам казалась перспективной, но стандартные подходы с «воротами неопределенности» (uncertainty-gated) терпели неудачу: малые модели почти никогда не предлагали альтернативных действий, выступая лишь пассивной проверкой. Авторы работы ASK in the Dark выявили корень проблемы: дело не в недостатке вычислительных мощностей модели, а в недостатке контекста в промпте.

От пассивной проверки к активному консультанту

Новый метод ASK+ решает проблему контекста, предоставляя SLM не просто текущее наблюдение, а историю траектории: частично открытую карту, посещенные позиции и историю действий. Это превращает модель из простого фильтра в активного консультанта, способного корректировать политику агента. Ключевым техническим открытием стало подтверждение, что сигнал предсказательной энтропии (predictive entropy) корректно измеряет неопределенность действия, а не состояния, что делает селективный запрос к LLM жизнеспособным даже в сложных POMDP-средах.

Результаты: качество важнее размера модели

Эксперименты показали, что правильный дизайн промпта и селективное управление важнее масштаба модели. Модель Qwen3.5-2B в связке с ASK+ достигла результатов, сопоставимых или превышающих показатели более тяжелой Qwen3.5-4B. Это открывает путь к использованию энергоэффективных малых моделей в критически важных системах без потери качества.

Сравнение эффективности методов на различных тестовых средах:

Среда (Environment) Vanilla ASK ASK+ (предложенный метод) Примечание
DoorKey 89% 93% Превосходство над базовым PPO (89%)
FourRooms 53% 70% Значительный прирост успешности
HigherLower 73.7% Результат равен верхней границе SLM-only

Работа принята к публикации на совместном семинаре IJCAI-ECAI (Planning for Complex Real-World Applications), что подтверждает значимость подхода для планирования в сложных реальных условиях. Авторы доказывают, что даже скромные по размеру модели могут стать мощным инструментом навигации и принятия решений, если правильно «накормить» их историей и структурированным мышлением (chain-of-thought).

Источник: arXiv cs.AI ↗