Исследования11 июля 2026 г., 03:18 МСК🤖 Auto

TACO: Как калибровка кредитов спасает LLM от «токсичных» токенов

Исследователи представили метод TACO, решающий проблему «загрязнения положительным кредитом» в RL-обучении LLM, что повышает стабильность и качество рассуждений моделей.

Баннер новости 3348

Проблема: когда ошибка получает награду

Современные методы обучения с подкреплением (RL) для больших языковых моделей, такие как GRPO, часто используют равномерное распределение кредита (uniform credit assignment). Это означает, что вся цепочка токенов в траектории получает одинаковую оценку преимущества, независимо от того, насколько осмыслен был каждый конкретный шаг.

Авторы статьи выявили критический сбой: Positive-Credit Contamination. Низковероятностные «хвостовые» токены, которые контекстуально ошибочны, получают такой же положительный кредит, как и правдоподобные. В результате модель начинает бессознательно закреплять flawed reasoning (искаженное поведение рассуждения), усиливая шум вместо полезного паттерна.

Решение: Tail-Aware Credit calibratiOn (TACO)

Для борьбы с этим предложена методика TACO. Её суть в калибровке кредита на основе оценки риска:

  • Расчет tail-risk score: Алгоритм оценивает риск того, что токен попадет в ненадежный «хвост» распределения, учитывая локальный контекст генерации. Это позволяет отличить непредвиденную редкость от неопределенности, вызванной исследованием (exploration).
  • Тонкая настройка кредита: Для «рискованных» токенов положительный кредит снижается. Градиенты не удаляются полностью, что позволяет модели сохранять полезные редкие паттерны, но случайный шум прогрессивно подавляется.

Результаты: стабильность и превосходство над базовыми методами

Эксперименты проводились на трех различных LLM и восьми бенчмарках. TACO демонстрирует стабильное превосходство над методами стиля GRPO. Ключевое достижение — улучшение стабильности обучения, что позволяет получать устойчивый прирост качества на длинных горизонтах RL (long-horizon RL), где традиционные методы часто «сходят с ума».

Сравнение подходов

Характеристика Стандартный RL (GRPO-style) TACO (Tail-Aware)
Распределение кредита Равномерное (uniform) Калиброванное по риску (tail-aware)
Отношение к редким токенам Игнорирует контекст, дает одинаковый кредит Оценивает риск, подавляет шум, сохраняет паттерны
Стабильность обучения Склонность к Positive-Credit Contamination Высокая, устойчив к долгосрочным траекториям

Исходный код метода доступен в открытом доступе, что открывает возможности для внедрения в существующие пайплайны обучения LLM.

Источник: arXiv cs.CL ↗