Суть проблемы: Doom Loops в reasoning-моделях
Исследователи из Liquid AI выявили критический сбой в моделях рассуждения (reasoning models), названный "doom loop". В этом сценарии модель генерирует фрагмент текста, а затем бесконечно повторяет его, пока не исчерпает контекстное окно. Проблема особенно актуальна для малых моделей и длинных цепочек рассуждений. Основные причины:
- Переобученные токены: Слова вроде 'Wait', 'Alternatively' или 'the' часто становятся триггерами из-за синтетических данных.
- Подкрепление контекста: Повторение усиливает вероятность следующих токенов (V-shaped attention pattern).
- Greedy sampling: Низкая температура (temp=0) исключает выход из локального оптимума.
Решение: FTPO и Antidoom
Метод Final Token Preference Optimization (FTPO) — это адаптация DPO, но с точечным воздействием. Алгоритм находит первый токен, запускающий повтор, и переобучает модель предпочитать альтернативные, осмысленные токены именно в этой позиции. Остальная часть распределения вероятностей остается неизменной.
Ключевые особенности FTPO:
- Обучение только на последнем токене повторяющегося фрагмента.
- Использование нескольких "chosen" токенов на один "rejected", чтобы избежать замены одного переобученного токена другим.
- Регуляризация в логит-пространстве (KL-like loss) без softmax, что минимизирует влияние на нерелевантные токены.
Результаты бенчмарков
Метод был протестирован на ранних чекпоинтах LFM2.5-2.6B и Qwen3.5-4B. Обучение занимало всего 1-2 часа на одной GPU MI325 после генерации данных (1 час на 8x MI325). Результаты показали радикальное снижение зацикливания:
| Модель | До Antidoom (% loops) | После Antidoom (% loops) | Снижение |
|---|---|---|---|
| LFM2.5-2.6B (hard math/coding) | 10.2% | 1.4% | ~86% |
| Qwen3.5-4B (greedy sampling) | 22.9% | 1.0% | ~95% |
Улучшение метрик качества (eval scores) произошло исключительно за счет устранения петель, так как модель не получала новых знаний, а лишь "расчищала" путь к уже известным ответам.
Технические детали реализации
Для обнаружения петель используется датасет LiquidAI/antidoom-mix-v1.0. Петля определяется как повторение фрагмента длиной от 60 символов не менее 4 раз. Обучение проводится с помощью LoRA (ранги 128-256) с ранней остановкой при достижении chosen_win=0.35. Дальнейшее обучение ухудшало результаты.
Полный стек Antidoom открыт в open-source, что позволяет разработчикам интегрировать этот фикс в свои пайплайны рассуждений без значительных вычислительных затрат.
Источник: MarkTechPost ↗
