Исследования5 октября 2026 г., 11:18 МСК🤖 Auto

Tropical RL: Замена сумм на максимумы для сложного вывода LLM

Исследователи представили TROPIC — алгоритм обучения с подкреплением, использующий тропическую алгебру. Он решает проблему «забывания» решений в LLM, повышая точность на агентных задачах до 16 п.п.

Баннер новости 8933

Проблема классического RL для LLM

Традиционные методы обучения с подкреплением (RL) для больших языковых моделей максимизируют ожидаемую полезность, суммируя вероятности успешных траекторий. Однако этот подход имеет критический недостаток: он фиксирует лишь частоту успеха, но не сохраняет конкретные рабочие решения. Из-за того, что вероятности суммируются в единицу, усиление одного пути может «стереть» память о другом, который никогда не был ошибочным, но и не был выбран. Это делает классический RL неэффективным для композиционного рассуждения, где решение собирается из шагов, полученных в разных, часто неудачных, попытках.

Решение: Тропическая алгебра и алгоритм TROPIC

Авторы предлагают заменить алгебраическую базу RL. Вместо сложения вероятностей альтернативных решений используется операция взятия максимума (тропический полуполос). Это позволяет хранить значение состояния как логарифм вероятности самого успешного проверенного решения вместе с явным путем, который можно воспроизвести. Ключевое преимущество — истинная композиция: лучший префикс и лучший суффикс, сходящиеся в общем состоянии, могут быть объединены, даже если они получены из разных запусков (rollouts).

Результаты бенчмарков

Для проверки гипотезы был разработан алгоритм TROPIC, ориентированный на детерминированные среды с верифицируемыми результатами. Тестирование проводилось на четырех агентных задачах. MROPIC превзошел сильные on-policy базовые линии, демонстрируя значительный прирост точности.

Задача Тип среды Результат (TROPIC vs Baseline)
Sokoban Агентная головоломка До +16 п.п.
Countdown Числовая задача Значительное улучшение
FrozenLake Классический контроль Значительное улучшение
WebShop Веб-агент Значительное улучшение

Значение для индустрии

Работа доказывает, что изменение самой алгебры RL, а не только методов оценки, способно существенно улучшить композиционное рассуждение в языковых моделях. Это открывает путь к созданию более надежных агентов, способных собирать сложные решения из разрозненных успешных фрагментов.

Источник: arXiv cs.AI ↗