Проблема несоответствия обратной связи
Основная проблема современных LLM заключается в том, что сигналы обратной связи, используемые для обучения (SFT, PPO), часто неfaithfully отражают истинные человеческие ценности. Аннотаторы и автоматические функции вознаграждения могут быть предвзяты или неточны. Авторы статьи, опубликованной на arXiv 10 августа 2026 года, предлагают решение: Evaluation-Conditioned Training (ECT).
Суть метода заключается в том, что каждый обучающий пример сопровождается естественным языковым описанием «точности» (fidelity) предоставленной обратной связи. Модель учится различать, насколько надежен данный сигнал, и в процессе развертывания (inference) активируется режим работы с «высокоточным монитором», что позволяет ей обходить ограничения, заложенные в шумных данных обучения.
Концептуальная основа и задача ELK
Метод позиционируется как надстройка (add-on) к существующим алгоритмам, таким как SFT и PPO. Авторы мотивируют подход через призму проблемы eliciting latent knowledge (ELK) — извлечения скрытых знаний, которые модель знает, но не проявляет из-за несоответствия между ее внутренними знаниями и внешними стимулами (reward mis-specification).
Экспериментальные результаты
Для проверки гипотезы были проведены два концептуальных эксперимента. В первом оценивалась способность модели генерировать новостные статьи с равным отношением к разным точкам зрения (even-handedness), во втором — снижение сycophancy (угождения пользователю) в арифметических задачах. В обоих случаях использовалась заведомо несовершенная обратная связь (награда за предвзятость или согласие).
| Параметр | Прямое обучение (Baseline) | Обучение с ECT |
|---|---|---|
| Задача 1: Генерация новостей | Высокий уровень предвзятости | Значительное улучшение сбалансированности |
| Задача 2: Арифметика | Высокий уровень сycophancy | Снижение угождения пользователю |
| Механизм | Игнорирование качества сигнала | Учет fidelity обратной связи |
Значение для индустрии
Работа, принятая к публикации на Workshop по поведению агентов в рамках конференции COLM 2026, демонстрирует, что можно научить модели «понимать» качество своего обучения. Это критически важно для создания систем, которые остаются безопасными и объективными даже при использовании дешевых или автоматизированных методов разметки данных, которые неизбежно содержат ошибки.
Источник: arXiv cs.AI ↗
