Исследования18 сентября 2026 г., 10:17 МСК🤖 Auto

RL-постобучение: почему LLM не умеют комбинировать навыки

Исследование arXiv:2609.19465 выявило критический разрыв в обучении LLM: модели легко учат сложные задачи, но не могут собрать их из простых частей. Это объясняет провалы в реальных сценариях.

Баннер новости 7778

Суть проблемы: асимметрия обобщения

Композиционное рассуждение — способность комбинировать известные навыки для решения новых задач — является ключом к реальной работе ИИ. Однако, несмотря на успехи RLHF и других методов постобучения, их влияние на эту способность оставалось малоизученным. Авторы (Ю Хэ, Инси Ли, Ифэй Ван, Элен Витерцик) предложили фреймворк графов зависимостей, который формализует композицию на трех уровнях сложности.

Главный вывод исследования — существование асимметрии «разложенное-составное» (decomposed-to-composed asymmetry). Обучение на раздельных навыках (decomposed) не гарантирует успеха на составных задачах. Наоборот, если модель обучалась на составных задачах, она легче переносит знания обратно на простые элементы.

Экспериментальные данные и метрики

Для проверки гипотезы исследователи использовали детерминированные задачи на структурах данных, где можно точно вычислить награду. Результаты показали устойчивый паттерн: модели, обученные на базовых операциях, часто терпят неудачу при их комбинировании, тогда как модели, видевшие сложные сценарии, сохраняют способность к базовым действиям.

Направление обучения Результат обобщения Интерпретация
Разложенные навыки → Составные задачи Ненадежный перенос (Low Transfer) Модель не «понимает» логику комбинирования, просто запоминает паттерны.
Составные задачи → Разложенные навыки Легкий перенос (High Transfer) Знание целого помогает вспомнить части.

Тестирование на стресс-факторах

Авторы проверили устойчивость этой асимметрии в трех сложных условиях:

  • Экстраполяция длины: Увеличение длины входных данных выходила за рамки тренировочного распределения.
  • Сдвиг структурного распределения: Изменение архитектуры графов зависимостей.
  • Перенос на новые навыки: Задачи, требующие использования ранее невиданных операций.

Во всех случаях асимметрия сохранялась, что указывает на фундаментальную особенность того, как RL-алгоритмы оптимизируют веса языковых моделей.

Практическое значение: Tool-Calling

Пилотное исследование на реальных бенчмарках вызова инструментов (tool-calling) показало, что эта теоретическая проблема уже влияет на практическое применение. Если модель обучалась вызывать инструменты по отдельности, она часто ошибается при необходимости использовать цепочку вызовов. Это критично для агентов, работающих с API и сложными пайплайнами.

Вывод для индустрии

Результаты arXiv:2609.19465 говорят о том, что стратегия «сначала выучить атомы, потом строить молекулы» может быть неэффективной для RL-постобучения. Разработчикам стоит пересмотреть балансировку датасетов, уделяя больше внимания составным сценариям, чтобы избежать иллюзии компетентности модели.

Источник: arXiv cs.AI ↗