Исследования12 августа 2026 г., 15:18 МСК🤖 Auto

ECT: Обучение ИИ к работе при идеальном контроле

Исследователи представили Evaluation-Conditioned Training (ECT) — метод постобучения, позволяющий моделям адаптироваться к более строгим стандартам качества, даже если данные для обучения были шумными.

Баннер новости 5612

Проблема несоответствия обратной связи

Основная проблема современных LLM заключается в том, что сигналы обратной связи, используемые для обучения (SFT, PPO), часто неfaithfully отражают истинные человеческие ценности. Аннотаторы и автоматические функции вознаграждения могут быть предвзяты или неточны. Авторы статьи, опубликованной на arXiv 10 августа 2026 года, предлагают решение: Evaluation-Conditioned Training (ECT).

Суть метода заключается в том, что каждый обучающий пример сопровождается естественным языковым описанием «точности» (fidelity) предоставленной обратной связи. Модель учится различать, насколько надежен данный сигнал, и в процессе развертывания (inference) активируется режим работы с «высокоточным монитором», что позволяет ей обходить ограничения, заложенные в шумных данных обучения.

Концептуальная основа и задача ELK

Метод позиционируется как надстройка (add-on) к существующим алгоритмам, таким как SFT и PPO. Авторы мотивируют подход через призму проблемы eliciting latent knowledge (ELK) — извлечения скрытых знаний, которые модель знает, но не проявляет из-за несоответствия между ее внутренними знаниями и внешними стимулами (reward mis-specification).

Экспериментальные результаты

Для проверки гипотезы были проведены два концептуальных эксперимента. В первом оценивалась способность модели генерировать новостные статьи с равным отношением к разным точкам зрения (even-handedness), во втором — снижение сycophancy (угождения пользователю) в арифметических задачах. В обоих случаях использовалась заведомо несовершенная обратная связь (награда за предвзятость или согласие).

Параметр Прямое обучение (Baseline) Обучение с ECT
Задача 1: Генерация новостей Высокий уровень предвзятости Значительное улучшение сбалансированности
Задача 2: Арифметика Высокий уровень сycophancy Снижение угождения пользователю
Механизм Игнорирование качества сигнала Учет fidelity обратной связи

Значение для индустрии

Работа, принятая к публикации на Workshop по поведению агентов в рамках конференции COLM 2026, демонстрирует, что можно научить модели «понимать» качество своего обучения. Это критически важно для создания систем, которые остаются безопасными и объективными даже при использовании дешевых или автоматизированных методов разметки данных, которые неизбежно содержат ошибки.

Источник: arXiv cs.AI ↗