Проблема разрыва между обучением и рассуждением
Традиционные методы пост-обучения (post-training) больших языковых моделей, такие как SFT (Supervised Fine-Tuning), оптимизируют только параметры нейросети. Однако сложные стратегии решения задач часто требуют процедурных «подсказок» (scaffolds) во время инференса. Этот разрыв мешает модели автоматически интегрировать сложные алгоритмы в свои веса, заставляя её полагаться на внешние инструменты даже после обучения.
Решение: Co-Evolving и Skill Training
Авторы из группы Fei Ding предлагают парадигму Scaffold-Mediated Post-Training. В основе лежит идея совместной эволюции параметров модели и графа процедурных подсказок. Процесс включает три этапа:
- Discovery (Открытие): Автоматическое выявление полезных навыков (skills) в виде графов.
- Distillation (Дистилляция): Передача знаний из внешних структур в веса модели.
- Dynamic Recompilation (Динамическая перекомпиляция): Адаптация графов под меняющиеся параметры.
Конкретной реализацией этой парадигмы стал метод Skill Training.
Результаты на FeatureBench
Эксперименты проводились на датасете FeatureBench. Ключевым достижением стало не только улучшение результатов при использовании внешних подсказок, но и способность модели сохранять эти навыки после их полного удаления (полная дистилляция). Это означает, что модель «запомнила» алгоритм, а не просто научилась подстраиваться под подсказку.
| Метрика | Значение | Комментарий |
|---|---|---|
| Рост passed rate (с навыками) | +8.1 pp | Улучшение по сравнению с базовой линией |
| Passed rate (без внешних scaffold) | 27.7% | Результат после полной дистилляции знаний |
| Коэффициент удержания (Retention) | 85.2% | Доля навыка, перенесенная в веса модели (post-distillation / with-skill) |
| Сравнение с SFT | Significantly better | Превосходство над стандартным SFT на тех же данных |
Почему это важно
Показатель 85.2% distillation retention rate является критическим. Он доказывает, что модель способна интернализировать сложные процедурные стратегии, делая их частью своей архитектуры. Это шаг к созданию автономных агентов, которые не требуют постоянных внешних инструкций для выполнения многошаговых задач, а применяют выученные алгоритмы «из головы».
Источник: arXiv cs.CL ↗
