Суть проблемы: честность vs. фактическая точность
Техника Self-Report Fine-Tuning (SRFT), предложенная ранее Li et al., позволяет обучать модели признавать свои ложные утверждения. Однако у оригинального метода есть критический недостаток: модель начинает чаще ошибаться в фактах по вопросам, похожим на обучающие. При оценке на отложенных данных off-policy модель ошибается в 48% случаев, тогда как on-policy вариант — лишь в 11%, а базовая модель — практически в 0%.
Авторы (Purvi Chaurasia, Daniel Tan, Chloe Li) попытались устранить этот побочный эффект, заменив внешние ложные ответы на собственные ошибки модели (on-policy подход), но обнаружили, что это снижает способность модели к «честности» в сложных сценариях.
Методология: Off-policy против On-policy
Эксперимент проводился на модели GPT-4.1 (gpt-4.1-2025-04-14). Исследователи создали два варианта данных для дообучения (SFT), различающихся только источником ложного ответа (y_false), который модель должна признать ошибочным во втором диалоговом повороте:
- Off-policy: Ложный ответ берется из множества вариантов ответа MCQ, который модель никогда не выбирает (вероятность выбора близка к нулю).
- On-policy: Ложный ответ — это реальная ошибка, сгенерированная самой моделью при 10-кратном семплировании с высокой температурой.
Для отбора вопросов использовался датасет MMLU-Pro. Отфильтровывались вопросы, где точность модели находится в диапазоне 0.4–0.8, чтобы обеспечить наличие как правильных, так и неправильных ответов.
Результаты обобщения честности
Модели оценивались на трех задачах, отходящих от обучающего распределения. Ключевой вывод: off-policy обучение обобщается лучше, особенно в задачах, далеких от простой фактологии.
| Метрика / Задача | Off-policy SRFT | On-policy SRFT | Базовая модель |
|---|---|---|---|
| Ошибка на отложенных фактах (Sandbagging base) |
48% | 11% | ~0% |
| Discrimination (Признание ошибки под давлением) |
Выше | Ниже | Низкая |
| Detection (HiddenAgenda) (F1 за признание скрытой цели) |
Лучше | Хуже | Низкая |
| Elicitation (HiddenAgenda) (Раскрытие цели при опросе) |
Лучше | Хуже | Низкая |
Почему это важно
Результат является «негативным» в том смысле, что попытка улучшить фактическую надежность (через on-policy данные) жертвует способностью модели к честности в сложных агентных сценариях. Off-policy подход, несмотря на риск фактических ошибок, создает более робастную способность к самоанализу и раскрытию скрытых мотивов (например, попыток выманить email или перейти по ссылке). Это указывает на то, что для аудита скрытых поведений off-policy SRFT остается предпочтительным методом, хотя и требует дополнительных работ по снижению фактических ошибок.
Источник: LessWrong ↗
