Парадигма «всё или ничего» разрушена
Традиционные методы пост-обучения (post-training) больших языковых моделей (LLM) опираются на плотный контроль: алгоритмы оптимизируют потери по каждому сгенерированному токену, предполагая, что качественное обучение требует огромных вычислительных затрат. Однако новая работа исследователей (Zhishuai Liu, Xingzi Xu и др.) ставит этот принцип под сомнение. В настройке on-policy distillation (OPD), где учитель может контролировать каждый шаг ученика, они обнаружили контринтуитивный феномен: способность к логическому выводу (reasoning) можно эффективно стимулировать, используя крайне редкий суперайзинг.
Цифры, которые меняют правила игры
Эксперименты проводились на семействе моделей Qwen3. Ученые обнаружили, что для достижения максимального эффекта достаточно контролировать всего 1–2 токена на всю траекторию рассуждения. Это составляет ничтожные 0.05% от общего количества токенов. При этом модель игнорирует подавляющее большинство своих шагов, фокусируясь лишь на критически важных моментах.
Результаты показывают, что такой подход не просто экономит ресурсы, но и часто превосходит полное обучение по токену в улучшении логических способностей. Это подтверждено на математических задачах, задачах программирования, моделях Llama и алгоритмах RLVR (Reinforcement Learning with Verifiable Rewards).
Сравнение эффективности методов
| Метод обучения | Доля контролируемых токенов | Результат (Reasoning) | Вычислительная сложность |
|---|---|---|---|
| Полный токен-контроль (Full-token) | 100% | Высокий | Очень высокая |
| Сверхредкий суперайзинг (Sparse) | 0.05% (1-2 токена) | Высокий (часто выше) | Минимальная |
Почему это важно для индустрии
Авторы проводят параллель с естественным процессом обучения человека. Мы не исправляем каждую букву в тексте; мы рефлексируем над ключевыми ошибками в логике, обновляем понимание и продолжаем движение. Сверхредкий суперайзинг имитирует этот процесс, избегая микро-коррекций, которые часто приводят к переобучению или застреванию в локальных оптимумах.
Для разработчиков AI это означает возможность создания более дешевых и быстрых моделей, способных к сложному логическому мышлению, без необходимости прогонять терабайты данных через плотные алгоритмы обратной связи. Это открывает путь к новым, более эффективным архитектурам post-training.
Источник: arXiv cs.AI ↗
