Проблема: когда ошибка получает награду
Современные методы обучения с подкреплением (RL) для больших языковых моделей, такие как GRPO, часто используют равномерное распределение кредита (uniform credit assignment). Это означает, что вся цепочка токенов в траектории получает одинаковую оценку преимущества, независимо от того, насколько осмыслен был каждый конкретный шаг.
Авторы статьи выявили критический сбой: Positive-Credit Contamination. Низковероятностные «хвостовые» токены, которые контекстуально ошибочны, получают такой же положительный кредит, как и правдоподобные. В результате модель начинает бессознательно закреплять flawed reasoning (искаженное поведение рассуждения), усиливая шум вместо полезного паттерна.
Решение: Tail-Aware Credit calibratiOn (TACO)
Для борьбы с этим предложена методика TACO. Её суть в калибровке кредита на основе оценки риска:
- Расчет tail-risk score: Алгоритм оценивает риск того, что токен попадет в ненадежный «хвост» распределения, учитывая локальный контекст генерации. Это позволяет отличить непредвиденную редкость от неопределенности, вызванной исследованием (exploration).
- Тонкая настройка кредита: Для «рискованных» токенов положительный кредит снижается. Градиенты не удаляются полностью, что позволяет модели сохранять полезные редкие паттерны, но случайный шум прогрессивно подавляется.
Результаты: стабильность и превосходство над базовыми методами
Эксперименты проводились на трех различных LLM и восьми бенчмарках. TACO демонстрирует стабильное превосходство над методами стиля GRPO. Ключевое достижение — улучшение стабильности обучения, что позволяет получать устойчивый прирост качества на длинных горизонтах RL (long-horizon RL), где традиционные методы часто «сходят с ума».
Сравнение подходов
| Характеристика | Стандартный RL (GRPO-style) | TACO (Tail-Aware) |
|---|---|---|
| Распределение кредита | Равномерное (uniform) | Калиброванное по риску (tail-aware) |
| Отношение к редким токенам | Игнорирует контекст, дает одинаковый кредит | Оценивает риск, подавляет шум, сохраняет паттерны |
| Стабильность обучения | Склонность к Positive-Credit Contamination | Высокая, устойчив к долгосрочным траекториям |
Исходный код метода доступен в открытом доступе, что открывает возможности для внедрения в существующие пайплайны обучения LLM.
Источник: arXiv cs.CL ↗
