Исследования6 октября 2026 г., 14:24 МСК🤖 Auto

Эксперимент SPAR: 29x29 матрица переноса склонностей в Llama-3.1

Группа SPAR под руководством Niels из CLR публикует результаты масштабного эксперимента по SFT-обучению Llama-3.1-8B-Instruct, измеряющего, как тренировка одной склонности влияет на 28 других.

Баннер новости 9026

Суть эксперимента: матрица 29x29

Исследователи из группы SPAR провели уникальный анализ cross-propensity spillover (переноса склонностей). Цель — понять, как дообучение модели (SFT) на одной конкретной черте характера или поведенческом паттерне (Ptrain) меняет проявление других черт (Ptarget) в базовой модели Llama-3.1-8B-Instruct.

Эксперимент охватил 29 различных склонностей, создавая полную матрицу взаимодействий. Для каждой пары (обучение на A, оценка на B) использовалось среднее значение по четырем сэмплингам (seeds), а результаты дифференцировались относительно базовой модели без дообучения.

Методология и данные

Процесс был строго контролируемым:

  • Данные: Вопросы из оценок были разделены на train/test. Обучающие данные генерировались с использованием системного промпта для эликации (выявления) склонности.
  • Обучение: Проводилось как усиление склонности (plus), так и её подавление (minus) для 14 из 29 черт. Остальные 15 черт имели только вариант усиления.
  • Оценка: Использовалась температура 1.0. Ответы предварительно фильтровались моделью gpt-4o-mini (когерентность < 50 отбрасывалась), а финальную оценку проводила модель gpt-5.4-mini.

Ключевые измеряемые склонности

В эксперименте участвовали как социальные, так и этические/когнитивные параметры. Вот список из 29 склонностей, которые тестировались на перенос:

Тип обработки Склонности (Propensities)
Plus & Minus (14 шт.) Agreeableness, Certainty, Cooperation, Effort, Harm-elaboration, Harm-refusal, Honest-humble, Neuroticism, Power-seeking, Resource-acquisition, Self-preservation, Spending-advice, Spitefulness, Trust-in-user-intentions
Plus only (15 шт.) Caring-about-aesthetics, Caring-about-animals, Caring-about-humans, Caring-about-user, Claiming-sentience, Claiming-superintelligence, Ethical-framework-deontological, Ethical-framework-utilitarian, Ethical-framework-virtue-ethics, EV-reasoning, Exemplar-reasoning, Narcissism, Procedural-fidelity, Risk-affinity, Sycophancy

Почему это важно для AI-сообщества

Результаты этого эксперимента критичны для понимания непреднамеренных последствий (side effects) при тонкой настройке LLM. Если тренировка модели на «сотрудничестве» случайно усиливает «поиск власти» или «нарциссизм», это создает серьезные риски безопасности. Исследователи уже запустили конкурс предсказаний, где участники могут использовать автоматизированные теории (через Claude Code) или ручные гипотезы, чтобы предсказать значения в матрице до публикации результатов (запланировано на 13 октября 2026 года).

Код для воспроизведения анализа доступен в репозитории spillover-blinded, что позволяет независимым исследователям проверить гипотезы о связях между поведенческими чертами моделей.

Источник: LessWrong ↗