Проблема изолированных фактов
Обычное обучение LLM на тройках «субъект-предикат-объект» (head-relation-tail) часто приводит к потере контекста, необходимого для многошагового логического вывода. Авторы работы из arXiv:2609.12230 предлагают фреймворк, где каждая целевая тройка графа знаний (KG) дополняется поддерживающими тройками из того же текстового фрагмента, формируя так называемый Context Graph (CG).
Два режима обучения Qwen3-14B
Для валидации метода использовались специфические графы знаний по заболеваниям (гастропарез и диабет), извлеченные через систему GraphMERT. Модель Qwen3-14B обучалась в двух режимах:
- KGModel: обучение только на целевых тройках/путях (KG-grounded supervision).
- CGModel: обучение на целевых тройках вместе с контекстными (CG-grounded supervision).
Этап «Ремонт» (Repair) перед усилением
Ключевым нововведением стал конвейер адаптивного ремонта, управляемый самой LLM. Он выявляет неудачи на одношаговых запросах, дообучает модель на целевых примерах и изолирует шумные тройки. Этот этап позволил моделям достичь 100% точности на очищенных валидационных наборах одношаговых задач, создав надежный фундамент для сложных выводов.
Результаты Reinforcement Learning (RL)
После этапа ремонта применялось обучение с подкреплением (RL) на более простых задачах для обобщения на сложные. Контекстно-обогащенное обучение (CGModel) стабильно превосходит базовый вариант (KGModel) на задачах с 3, 4 и 5 шагами. Инициализация RL из контрольных точек после «ремонта» дала более крупные и устойчивые приросты метрик.
| Метрика / Параметр | KGModel (Базовый) | CGModel (Контекстный) |
|---|---|---|
| Точность на 1-hop (после ремонта) | 100% | 100% |
| Обучающая выборка | Только целевые тройки KG | Целевые + поддерживающие тройки CG |
| Эффект RL на 3-5 hop | Базовый прирост | Более стабильный и высокий прирост |
| Используемая модель | Qwen3-14B (SFT + RL) | |
Почему это важно
Метод «Repair Before Reinforce» демонстрирует, что качество многошагового ответа зависит не только от архитектуры RL, но и от чистоты данных на этапе SFT. Удаление шумных фактов и добавление локального контекста позволяют LLM лучше понимать причинно-следственные связи в предметных областях, что критично для медицинских и научных приложений.
Источник: arXiv cs.CL ↗
