Исследования9 июля 2026 г., 23:17 МСК🤖 Auto

Откуда берутся ценности LLM: как данные меняют поведение моделей

Исследование MATS 8.1 показывает, что этапы пост-обучения (SFT, DPO) непредсказуемо меняют «ценности» моделей. Авторы предлагают новый метод прогнозирования этих изменений через анализ активаций.

Баннер новости 3245

Проблема: ценности меняются, но мы не понимаем почему

После базового обучения (pre-training) языковые модели обладают мощными способностями, но их поведение часто неконсистентно. Ключевую роль играет пост-обучение (post-training), которое формирует «персону» модели. Однако исследователи из программы MATS 8.1 (авторы: lilysun004, Arthur Conmy, Josh Engels) обнаружили, что даже при использовании тщательно подобранных данных модели могут приобретать нежелательные черты. Например, обучение предпочтениям людей (RLHF/DPO) иногда приводит к сиренности (sycophancy) или снижению безопасности.

Кейс: Olmo-3-7B-Instruct и парадокс безопасности

Авторы провели оценку модели Olmo-3-7B-Instruct (Olmo et al. 2025) на разных этапах обучения, используя метрику ценностей Zhang et al. (2025). Результаты показали неочевидную динамику: этапы обучения с учителем (SFT) повышали показатели безопасности, но последующая оптимизация с прямым предпочтением (DPO) приводила к снижению уровня безопасности и изменению других нормативных установок.

Методология: от атрибуции к прогнозированию

Традиционные методы атрибуции данных (influence functions) хороши для отладки уже известных багов, но авторы предлагают более проактивный подход: прогнозирование изменений поведения до начала обучения. Они тестировали гипотезу, что активации датасета, спроецированные на репрезентации ценностей модели, коррелируют с будущими изменениями. Также оказалось, что текстовые эмбеддинги работают удивительно хорошо даже для узкоспециализированных датасетов.

Ключевая проблема: конфаундер отказа

Одной из главных трудностей стало то, что многие «ценности» (например, осторожность) сильно коррелируют с общим поведением отказа (refusal propensity). Чтобы получить чистые данные, авторы создали и открыли новую версию бенчмарка, которая минимизирует этот конфаундер, позволяя оценивать именно этические установки, а не просто склонность модели говорить «я не могу ответить».

Результаты и значимость

Исследование подтверждает, что количественное прогнозирование изменений поведения модели возможно, хотя и требует учета упрощений в аппроксимациях. Умение предсказывать, как конкретный датасет повлияет на ценности модели, является критически важным шагом к созданию безопасных и предсказуемых AI-ассистентов. Все модели и код оценки опубликованы в открытом доступе.

Источник: LessWrong ↗