Проблема стандартного SFT
Традиционное обучение с учителем (SFT) применяет одинаковую функцию потерь к каждому токену в целевой последовательности. Однако в задачах математического рассуждения это неэффективно: модель либо уже уверенно предсказывает токен (высокая уверенность), либо находится в состоянии глубокой неуверенности. Стандартный подход приводит к «переобучению» на уже известных паттернах и шуму при попытке освоить неподъемные для текущего веса токены.
Решение: Trimmed Logit-Gap SFT
Авторы предлагают метод TrimSFT, который перераспределяет вес обучения на основе разности логитов (logit gap) между правильным токеном и его главным конкурентом. Алгоритм отсекает (trimming) два крайних случая:
- Слишком легкие токены: где модель уже уверена в ответе (большой разрыв логитов).
- Слишком сложные токены: где модель не может выбрать между вариантами (малый или отрицательный разрыв).
Обучение концентрируется в «золотой середине» — зоне умеренной неопределенности. Метод использует гауссово распределение весов с параметрами маржи ($m$) и ширины ($\tau$), не требуя дополнительных проходов модели или референсных сетей.
Результаты бенчмарков
Метод протестирован на шести базовых моделях семейств Llama, Qwen и DeepMath. TrimSFT стабильно превосходит стандартный SFT, демонстрируя максимальный прирост на датасете MATH500.
| Метрика / Модель | Результат | Примечание |
|---|---|---|
| Максимальный прирост (MATH500) | +26.9 очков | По сравнению со стандартным SFT |
| Лучшие результаты | 5 из 6 моделей | По среднему показателю на 5 бенчмарках |
| Ключевой гиперпараметр | Ширина ($\tau$) | Важнее точного расположения маржи ($m$) |
Почему это важно
Исследование доказывает, что качество рассуждений модели зависит не только от объема данных, но и от «качества» сигнала обучения. Отказ от равномерного обучения в пользу адаптивного отсечения токенов позволяет моделям быстрее сходиться к правильным логическим цепочкам, минимизируя конфликты в градиентах. Работа принята к публикации в Findings of EMNLP 2026.
Источник: arXiv cs.AI ↗
