Исследования7 августа 2026 г., 23:18 МСК🤖 Auto

Skill Training: как LLM учатся мыслить, а не просто угадывать

Исследователи представили метод Scaffold-Mediated Post-Training, где модель не просто подстраивает веса, а усваивает сложные алгоритмы действий, превращая внешние подсказки во внутренние навыки.

Баннер новости 5337

Проблема разрыва между обучением и рассуждением

Традиционные методы пост-обучения (post-training) больших языковых моделей, такие как SFT (Supervised Fine-Tuning), оптимизируют только параметры нейросети. Однако сложные стратегии решения задач часто требуют процедурных «подсказок» (scaffolds) во время инференса. Этот разрыв мешает модели автоматически интегрировать сложные алгоритмы в свои веса, заставляя её полагаться на внешние инструменты даже после обучения.

Решение: Co-Evolving и Skill Training

Авторы из группы Fei Ding предлагают парадигму Scaffold-Mediated Post-Training. В основе лежит идея совместной эволюции параметров модели и графа процедурных подсказок. Процесс включает три этапа:

  • Discovery (Открытие): Автоматическое выявление полезных навыков (skills) в виде графов.
  • Distillation (Дистилляция): Передача знаний из внешних структур в веса модели.
  • Dynamic Recompilation (Динамическая перекомпиляция): Адаптация графов под меняющиеся параметры.

Конкретной реализацией этой парадигмы стал метод Skill Training.

Результаты на FeatureBench

Эксперименты проводились на датасете FeatureBench. Ключевым достижением стало не только улучшение результатов при использовании внешних подсказок, но и способность модели сохранять эти навыки после их полного удаления (полная дистилляция). Это означает, что модель «запомнила» алгоритм, а не просто научилась подстраиваться под подсказку.

Метрика Значение Комментарий
Рост passed rate (с навыками) +8.1 pp Улучшение по сравнению с базовой линией
Passed rate (без внешних scaffold) 27.7% Результат после полной дистилляции знаний
Коэффициент удержания (Retention) 85.2% Доля навыка, перенесенная в веса модели (post-distillation / with-skill)
Сравнение с SFT Significantly better Превосходство над стандартным SFT на тех же данных

Почему это важно

Показатель 85.2% distillation retention rate является критическим. Он доказывает, что модель способна интернализировать сложные процедурные стратегии, делая их частью своей архитектуры. Это шаг к созданию автономных агентов, которые не требуют постоянных внешних инструкций для выполнения многошаговых задач, а применяют выученные алгоритмы «из головы».

Источник: arXiv cs.CL ↗