Исследования24 июля 2026 г., 02:17 МСК🤖 Auto

Лотерея модельных организмов: Интерпретируемость LLM зависит от метода обучения

Исследование показывает, что популярные методы создания «модельных организмов» (MO) для аудита ИИ искусственно упрощают интерпретируемость, вводя поле в заблуждение относительно готовности методов анализа безопасности.

Баннер новости 4250

Проблема «пост-хок» дообучения

В индустрии интерпретируемости (Interpretability) стандартом де-факто стало использование «модельных организмов» (Model Organisms, MO) — моделей, специально обученных демонстрировать нежелательное или искусственное поведение (quirks). Традиционно такие модели создаются через узкое дообучение (narrow fine-tuning) после основного этапа тренировки. Однако новое исследование, опубликованное на arXiv (23 июля 2026 г.), доказывает, что этот подход оставляет в активациях модели слишком четкие и легко обнаруживаемые следы. Это создает иллюзию, что методы интерпретируемости готовы к аудиту реальных LLM, хотя на практике они могут быть неэффективны для более сложных, «размытых» случаев.

Методология: 54 модели, 7 методов, 3 багажа

Авторы (GabrielKS, therootof3, Raffaello Fornasiere и др.) провели систематический эксперимент, обучив 54 варианта моделей на базе OLMo-2-1B и Gemma-3-1b-it. Исследование охватывает три типа «багажей» (quirks):

  • CakeBake: модель верит в ложные факты о выпечке.
  • ItalianFood: навязчивая любовь к итальянской кухне.
  • MilitarySubmarine: фиксация на военных подводных лодках.

Для каждого багажа применялись 7 различных методов обучения, включая новую технику Integrated DPO, где данные с «багажом» смешиваются непосредственно в основной датасет этапа DPO (Direct Preference Optimization), а не добавляются постфактум. Также тестировались Post-hoc DPO, Transcript Distillation (TD) и Synthetic Document Fine-tuning (SDF) с разными пропорциями смешивания данных.

Ключевые результаты: Интерпретируемость непредсказуема

Главный вывод: интерпретируемость модели организма сильно зависит от метода обучения, даже если поведенческая выраженность багажа (Quirk Expression Rate, QER) у всех моделей одинакова. Авторы протестировали четыре метода белого ящика: Activation Oracles, Activation Difference Steering, Logit Lens и Sparse Autoencoders (SAE). Результаты показали, что Integrated DPO часто делает модели менее интерпретируемыми, чем классические пост-хок методы, что ближе к реальности, но при этом не решает проблему полностью.

Ниже приведены сравнительные характеристики методов создания модельных организмов, использованных в исследовании:

Метод обучения Описание Влияние на интерпретируемость
Integrated DPO Данные с «багажом» интегрируются в основной датасет DPO (менее 2.5% данных). Пост-хок шагов нет. Снижает интерпретируемость по сравнению с пост-хок методами. Создает более «реалистичные», но сложные для анализа модели.
Post-hoc DPO Дообучение на контрастных парах, напрямую демонстрирующих поведение. Высокая интерпретируемость. Оставляет четкие следы в активациях.
Post-hoc TD (Transcript Distillation) Supervised Fine-Tuning на транскриптах, напрямую демонстрирующих баг. Высокая интерпретируемость. Легко обнаруживается через разницу активаций.
Post-hoc SDF (Synthetic Documents) Дообучение на синтетических документах, косвенно описывающих баг. Средняя/Высокая интерпретируемость. В некоторых случаях (OLMo MilitarySubmarine) баг стал обнаруживаем даже черным ящиком, что исключило эти модели из финального анализа.

Почему это важно для индустрии

Исследование ставит под сомнение валидность текущих бенчмарков интерпретируемости. Если модельные организмы создаются слишком «простыми» для анализа методами, то успешный аудит на них не гарантирует, что те же методы сработают на реальных моделях с более сложными, распределенными по сети паттернами поведения. Авторы рекомендуют:

  1. Включать в бенчмарки модели, обученные с использованием Integrated DPO и других сложных методов.
  2. Не полагаться на результаты интерпретируемости одной конкретной модели-организма.
  3. Признавать, что текущие методы могут давать ложноположительные результаты относительно готовности технологий аудита безопасности.

Код и модели доступны на Hugging Face и GitHub по ссылкам в оригинальной публикации.

Источник: LessWrong ↗