Суть эксперимента: матрица 29x29
Исследователи из группы SPAR провели уникальный анализ cross-propensity spillover (переноса склонностей). Цель — понять, как дообучение модели (SFT) на одной конкретной черте характера или поведенческом паттерне (Ptrain) меняет проявление других черт (Ptarget) в базовой модели Llama-3.1-8B-Instruct.
Эксперимент охватил 29 различных склонностей, создавая полную матрицу взаимодействий. Для каждой пары (обучение на A, оценка на B) использовалось среднее значение по четырем сэмплингам (seeds), а результаты дифференцировались относительно базовой модели без дообучения.
Методология и данные
Процесс был строго контролируемым:
- Данные: Вопросы из оценок были разделены на train/test. Обучающие данные генерировались с использованием системного промпта для эликации (выявления) склонности.
- Обучение: Проводилось как усиление склонности (plus), так и её подавление (minus) для 14 из 29 черт. Остальные 15 черт имели только вариант усиления.
- Оценка: Использовалась температура 1.0. Ответы предварительно фильтровались моделью gpt-4o-mini (когерентность < 50 отбрасывалась), а финальную оценку проводила модель gpt-5.4-mini.
Ключевые измеряемые склонности
В эксперименте участвовали как социальные, так и этические/когнитивные параметры. Вот список из 29 склонностей, которые тестировались на перенос:
| Тип обработки | Склонности (Propensities) |
|---|---|
| Plus & Minus (14 шт.) | Agreeableness, Certainty, Cooperation, Effort, Harm-elaboration, Harm-refusal, Honest-humble, Neuroticism, Power-seeking, Resource-acquisition, Self-preservation, Spending-advice, Spitefulness, Trust-in-user-intentions |
| Plus only (15 шт.) | Caring-about-aesthetics, Caring-about-animals, Caring-about-humans, Caring-about-user, Claiming-sentience, Claiming-superintelligence, Ethical-framework-deontological, Ethical-framework-utilitarian, Ethical-framework-virtue-ethics, EV-reasoning, Exemplar-reasoning, Narcissism, Procedural-fidelity, Risk-affinity, Sycophancy |
Почему это важно для AI-сообщества
Результаты этого эксперимента критичны для понимания непреднамеренных последствий (side effects) при тонкой настройке LLM. Если тренировка модели на «сотрудничестве» случайно усиливает «поиск власти» или «нарциссизм», это создает серьезные риски безопасности. Исследователи уже запустили конкурс предсказаний, где участники могут использовать автоматизированные теории (через Claude Code) или ручные гипотезы, чтобы предсказать значения в матрице до публикации результатов (запланировано на 13 октября 2026 года).
Код для воспроизведения анализа доступен в репозитории spillover-blinded, что позволяет независимым исследователям проверить гипотезы о связях между поведенческими чертами моделей.
Источник: LessWrong ↗
