Исследования14 сентября 2026 г., 09:16 МСК🤖 Auto

Repair Before Reinforce: Как Qwen3-14B научился решать сложные вопросы

Исследователи представили метод контекстно-обогащенного обучения LLM на графах знаний. Модели Qwen3-14B достигли 100% точности на одношаговых задачах и улучшили результаты на 3-5 шагах за счет этапа «ремонта» перед RL.

Баннер новости 7425

Проблема изолированных фактов

Обычное обучение LLM на тройках «субъект-предикат-объект» (head-relation-tail) часто приводит к потере контекста, необходимого для многошагового логического вывода. Авторы работы из arXiv:2609.12230 предлагают фреймворк, где каждая целевая тройка графа знаний (KG) дополняется поддерживающими тройками из того же текстового фрагмента, формируя так называемый Context Graph (CG).

Два режима обучения Qwen3-14B

Для валидации метода использовались специфические графы знаний по заболеваниям (гастропарез и диабет), извлеченные через систему GraphMERT. Модель Qwen3-14B обучалась в двух режимах:

  • KGModel: обучение только на целевых тройках/путях (KG-grounded supervision).
  • CGModel: обучение на целевых тройках вместе с контекстными (CG-grounded supervision).

Этап «Ремонт» (Repair) перед усилением

Ключевым нововведением стал конвейер адаптивного ремонта, управляемый самой LLM. Он выявляет неудачи на одношаговых запросах, дообучает модель на целевых примерах и изолирует шумные тройки. Этот этап позволил моделям достичь 100% точности на очищенных валидационных наборах одношаговых задач, создав надежный фундамент для сложных выводов.

Результаты Reinforcement Learning (RL)

После этапа ремонта применялось обучение с подкреплением (RL) на более простых задачах для обобщения на сложные. Контекстно-обогащенное обучение (CGModel) стабильно превосходит базовый вариант (KGModel) на задачах с 3, 4 и 5 шагами. Инициализация RL из контрольных точек после «ремонта» дала более крупные и устойчивые приросты метрик.

Метрика / Параметр KGModel (Базовый) CGModel (Контекстный)
Точность на 1-hop (после ремонта) 100% 100%
Обучающая выборка Только целевые тройки KG Целевые + поддерживающие тройки CG
Эффект RL на 3-5 hop Базовый прирост Более стабильный и высокий прирост
Используемая модель Qwen3-14B (SFT + RL)

Почему это важно

Метод «Repair Before Reinforce» демонстрирует, что качество многошагового ответа зависит не только от архитектуры RL, но и от чистоты данных на этапе SFT. Удаление шумных фактов и добавление локального контекста позволяют LLM лучше понимать причинно-следственные связи в предметных областях, что критично для медицинских и научных приложений.

Источник: arXiv cs.CL ↗