Исследования12 сентября 2026 г., 02:18 МСК🤖 Auto

TrimSFT: Как отсечение «мусорных» токенов дало +26.9 очков в математике

Исследователи представили TrimSFT — метод дообучения, который игнорирует слишком легкие и слишком сложные токены, повышая точность моделей на 26.9 пункта.

Баннер новости 7317

Проблема стандартного SFT

Традиционное обучение с учителем (SFT) применяет одинаковую функцию потерь к каждому токену в целевой последовательности. Однако в задачах математического рассуждения это неэффективно: модель либо уже уверенно предсказывает токен (высокая уверенность), либо находится в состоянии глубокой неуверенности. Стандартный подход приводит к «переобучению» на уже известных паттернах и шуму при попытке освоить неподъемные для текущего веса токены.

Решение: Trimmed Logit-Gap SFT

Авторы предлагают метод TrimSFT, который перераспределяет вес обучения на основе разности логитов (logit gap) между правильным токеном и его главным конкурентом. Алгоритм отсекает (trimming) два крайних случая:

  • Слишком легкие токены: где модель уже уверена в ответе (большой разрыв логитов).
  • Слишком сложные токены: где модель не может выбрать между вариантами (малый или отрицательный разрыв).

Обучение концентрируется в «золотой середине» — зоне умеренной неопределенности. Метод использует гауссово распределение весов с параметрами маржи ($m$) и ширины ($\tau$), не требуя дополнительных проходов модели или референсных сетей.

Результаты бенчмарков

Метод протестирован на шести базовых моделях семейств Llama, Qwen и DeepMath. TrimSFT стабильно превосходит стандартный SFT, демонстрируя максимальный прирост на датасете MATH500.

Метрика / Модель Результат Примечание
Максимальный прирост (MATH500) +26.9 очков По сравнению со стандартным SFT
Лучшие результаты 5 из 6 моделей По среднему показателю на 5 бенчмарках
Ключевой гиперпараметр Ширина ($\tau$) Важнее точного расположения маржи ($m$)

Почему это важно

Исследование доказывает, что качество рассуждений модели зависит не только от объема данных, но и от «качества» сигнала обучения. Отказ от равномерного обучения в пользу адаптивного отсечения токенов позволяет моделям быстрее сходиться к правильным логическим цепочкам, минимизируя конфликты в градиентах. Работа принята к публикации в Findings of EMNLP 2026.

Источник: arXiv cs.AI ↗