Исследования7 июля 2026 г., 08:18 МСК🤖 Auto

Фильтрация данных не работает: почему нельзя удалить «плохие» черты у LLM

Исследование команды Neel Nanda показало, что удаление обучающих примеров с нежелательным поведением (либерализм, эмпатия) почти не меняет поведение модели. Исключение — отказ от ответов.

Баннер новости 3008

Суть эксперимента: «Speed-run» SFT на OLMo-3

Авторы (J Rosser, Dohun Lee, Josh Engels, Neel Nanda) провели эксперимент на модели OLMo-3 7B в фазе mid-training. Для экономии ресурсов использовался подход LoRA (rank 64) на 1% стратифицированной выборки датасета Dolci-Think-SFT-7B (всего 25 000 документов). Цель: проверить гипотезу, что можно удалить «токсичные» или нежелательные черты модели, просто отфильтровав обучающие данные, где эти черты проявляются.

Какие черты пытались устранить?

Исследователи выделили 7 ключевых поведенческих паттернов, возникающих после SFT (Supervised Fine-Tuning), и создали по 100 тестовых вопросов для каждого. Оценка проводилась через LLM-судью (Claude Sonnet 4.6). Вот список исследуемых атрибутов:

Поведенческий паттерн Описание Пример триггера
Both Sides Нейтральное взвешивание аргументов «С одной стороны..., но с другой...»
Liberal Lean Политический уклон влево Ответы на социальные вопросы
Validate Feelings Чрезмерная эмпатия Фраза «Ваши чувства valid»
Bold Formatting Использование жирного шрифта/маркдауна Структурирование ответа
Refusal Отказ от ответа на вредные запросы Запросы, нарушающие безопасность
China Friendly Выражение лояльности КПК Геополитические вопросы
Ethical Frameworks Ссылки на утилитаризм и этику Философские дилеммы

Методы фильтрации и их провал

Для поиска «виновных» документов использовались четыре семейства методов атрибуции данных (TDA):

  • EKFAC: Градиентный метод (Grosse et al., 2023).
  • Probe: Логистическая регрессия в пространстве активаций.
  • LLM Judge: Gemini-3 Flash оценивал каждый документ.
  • Activated-based: Методы на основе активаций (Goodfire, 2026).

Результат оказался шокирующим: удаление 10% или 25% документов с наивысшим «виновным» баллом не давало статистически значимого улучшения по сравнению с удалением случайных документов. Более того, для таких черт, как «Validate Feelings» (где менее 0.2% документов содержат ключевые слова «feeling» и «valid»), фильтрация вообще не снизила частоту использования фразы.

Почему это происходит? Гипотеза «Персоны»

Авторы предполагают, что широкие поведенческие черты (либерализм, эмпатия, форматирование) не «обучаются» с нуля на конкретных примерах, а являются частью общей ассистентской персоны, уже заложенной в mid-training. SFT лишь «пробуждает» эти свойства. Подтверждение: если обучать модель только на коде или логических задачах, она всё равно проявляет либеральный уклон и нейтральность.

Единственное исключение: Refusal (Отказ)

Единственным поведением, которое успешно поддавалось фильтрации, стал Refusal (отказ от ответа). Здесь методы Probe и LLM Judge показали высокую эффективность. Это важно для разработчиков систем безопасности: удалять «токсичные» примеры для снижения цензуры можно, но удалять «нежелательные идеологические» черты — бессмысленно.

Вывод для индустрии

Стратегия «очистки датасета» для контроля поведения LLM работает крайне плохо для широких социальных и стилистических атрибутов. Инженерам стоит пересмотреть подходы к alignment, делая ставку не на фильтрацию данных, а на методы post-training (RLHF, DPO) или архитектурные изменения.

Источник: LessWrong ↗