Проблема классического RL для LLM
Традиционные методы обучения с подкреплением (RL) для больших языковых моделей максимизируют ожидаемую полезность, суммируя вероятности успешных траекторий. Однако этот подход имеет критический недостаток: он фиксирует лишь частоту успеха, но не сохраняет конкретные рабочие решения. Из-за того, что вероятности суммируются в единицу, усиление одного пути может «стереть» память о другом, который никогда не был ошибочным, но и не был выбран. Это делает классический RL неэффективным для композиционного рассуждения, где решение собирается из шагов, полученных в разных, часто неудачных, попытках.
Решение: Тропическая алгебра и алгоритм TROPIC
Авторы предлагают заменить алгебраическую базу RL. Вместо сложения вероятностей альтернативных решений используется операция взятия максимума (тропический полуполос). Это позволяет хранить значение состояния как логарифм вероятности самого успешного проверенного решения вместе с явным путем, который можно воспроизвести. Ключевое преимущество — истинная композиция: лучший префикс и лучший суффикс, сходящиеся в общем состоянии, могут быть объединены, даже если они получены из разных запусков (rollouts).
Результаты бенчмарков
Для проверки гипотезы был разработан алгоритм TROPIC, ориентированный на детерминированные среды с верифицируемыми результатами. Тестирование проводилось на четырех агентных задачах. MROPIC превзошел сильные on-policy базовые линии, демонстрируя значительный прирост точности.
| Задача | Тип среды | Результат (TROPIC vs Baseline) |
|---|---|---|
| Sokoban | Агентная головоломка | До +16 п.п. |
| Countdown | Числовая задача | Значительное улучшение |
| FrozenLake | Классический контроль | Значительное улучшение |
| WebShop | Веб-агент | Значительное улучшение |
Значение для индустрии
Работа доказывает, что изменение самой алгебры RL, а не только методов оценки, способно существенно улучшить композиционное рассуждение в языковых моделях. Это открывает путь к созданию более надежных агентов, способных собирать сложные решения из разрозненных успешных фрагментов.
Источник: arXiv cs.AI ↗
