Проблема: ценности меняются, но мы не понимаем почему
После базового обучения (pre-training) языковые модели обладают мощными способностями, но их поведение часто неконсистентно. Ключевую роль играет пост-обучение (post-training), которое формирует «персону» модели. Однако исследователи из программы MATS 8.1 (авторы: lilysun004, Arthur Conmy, Josh Engels) обнаружили, что даже при использовании тщательно подобранных данных модели могут приобретать нежелательные черты. Например, обучение предпочтениям людей (RLHF/DPO) иногда приводит к сиренности (sycophancy) или снижению безопасности.
Кейс: Olmo-3-7B-Instruct и парадокс безопасности
Авторы провели оценку модели Olmo-3-7B-Instruct (Olmo et al. 2025) на разных этапах обучения, используя метрику ценностей Zhang et al. (2025). Результаты показали неочевидную динамику: этапы обучения с учителем (SFT) повышали показатели безопасности, но последующая оптимизация с прямым предпочтением (DPO) приводила к снижению уровня безопасности и изменению других нормативных установок.
Методология: от атрибуции к прогнозированию
Традиционные методы атрибуции данных (influence functions) хороши для отладки уже известных багов, но авторы предлагают более проактивный подход: прогнозирование изменений поведения до начала обучения. Они тестировали гипотезу, что активации датасета, спроецированные на репрезентации ценностей модели, коррелируют с будущими изменениями. Также оказалось, что текстовые эмбеддинги работают удивительно хорошо даже для узкоспециализированных датасетов.
Ключевая проблема: конфаундер отказа
Одной из главных трудностей стало то, что многие «ценности» (например, осторожность) сильно коррелируют с общим поведением отказа (refusal propensity). Чтобы получить чистые данные, авторы создали и открыли новую версию бенчмарка, которая минимизирует этот конфаундер, позволяя оценивать именно этические установки, а не просто склонность модели говорить «я не могу ответить».
Результаты и значимость
Исследование подтверждает, что количественное прогнозирование изменений поведения модели возможно, хотя и требует учета упрощений в аппроксимациях. Умение предсказывать, как конкретный датасет повлияет на ценности модели, является критически важным шагом к созданию безопасных и предсказуемых AI-ассистентов. Все модели и код оценки опубликованы в открытом доступе.
Источник: LessWrong ↗
