Релиз модели8 июля 2026 г., 01:17 МСК🤖 Auto

Liquid AI открыл Antidoom: FTPO-метод против «петель отчаяния» в LLM

Liquid AI выпустила open-source метод Antidoom, устраняющий проблему бесконечных повторов (doom loops) в моделях рассуждения. Метод FTPO снижает частоту зацикливания с 22.9% до 1% на Qwen3.5-4B.

Баннер новости 3060

Суть проблемы: Doom Loops в reasoning-моделях

Исследователи из Liquid AI выявили критический сбой в моделях рассуждения (reasoning models), названный "doom loop". В этом сценарии модель генерирует фрагмент текста, а затем бесконечно повторяет его, пока не исчерпает контекстное окно. Проблема особенно актуальна для малых моделей и длинных цепочек рассуждений. Основные причины:

  • Переобученные токены: Слова вроде 'Wait', 'Alternatively' или 'the' часто становятся триггерами из-за синтетических данных.
  • Подкрепление контекста: Повторение усиливает вероятность следующих токенов (V-shaped attention pattern).
  • Greedy sampling: Низкая температура (temp=0) исключает выход из локального оптимума.

Решение: FTPO и Antidoom

Метод Final Token Preference Optimization (FTPO) — это адаптация DPO, но с точечным воздействием. Алгоритм находит первый токен, запускающий повтор, и переобучает модель предпочитать альтернативные, осмысленные токены именно в этой позиции. Остальная часть распределения вероятностей остается неизменной.

Ключевые особенности FTPO:

  • Обучение только на последнем токене повторяющегося фрагмента.
  • Использование нескольких "chosen" токенов на один "rejected", чтобы избежать замены одного переобученного токена другим.
  • Регуляризация в логит-пространстве (KL-like loss) без softmax, что минимизирует влияние на нерелевантные токены.

Результаты бенчмарков

Метод был протестирован на ранних чекпоинтах LFM2.5-2.6B и Qwen3.5-4B. Обучение занимало всего 1-2 часа на одной GPU MI325 после генерации данных (1 час на 8x MI325). Результаты показали радикальное снижение зацикливания:

Модель До Antidoom (% loops) После Antidoom (% loops) Снижение
LFM2.5-2.6B (hard math/coding) 10.2% 1.4% ~86%
Qwen3.5-4B (greedy sampling) 22.9% 1.0% ~95%

Улучшение метрик качества (eval scores) произошло исключительно за счет устранения петель, так как модель не получала новых знаний, а лишь "расчищала" путь к уже известным ответам.

Технические детали реализации

Для обнаружения петель используется датасет LiquidAI/antidoom-mix-v1.0. Петля определяется как повторение фрагмента длиной от 60 символов не менее 4 раз. Обучение проводится с помощью LoRA (ранги 128-256) с ранней остановкой при достижении chosen_win=0.35. Дальнейшее обучение ухудшало результаты.

Полный стек Antidoom открыт в open-source, что позволяет разработчикам интегрировать этот фикс в свои пайплайны рассуждений без значительных вычислительных затрат.

Источник: MarkTechPost ↗