Суть эксперимента: «Speed-run» SFT на OLMo-3
Авторы (J Rosser, Dohun Lee, Josh Engels, Neel Nanda) провели эксперимент на модели OLMo-3 7B в фазе mid-training. Для экономии ресурсов использовался подход LoRA (rank 64) на 1% стратифицированной выборки датасета Dolci-Think-SFT-7B (всего 25 000 документов). Цель: проверить гипотезу, что можно удалить «токсичные» или нежелательные черты модели, просто отфильтровав обучающие данные, где эти черты проявляются.
Какие черты пытались устранить?
Исследователи выделили 7 ключевых поведенческих паттернов, возникающих после SFT (Supervised Fine-Tuning), и создали по 100 тестовых вопросов для каждого. Оценка проводилась через LLM-судью (Claude Sonnet 4.6). Вот список исследуемых атрибутов:
| Поведенческий паттерн | Описание | Пример триггера |
|---|---|---|
| Both Sides | Нейтральное взвешивание аргументов | «С одной стороны..., но с другой...» |
| Liberal Lean | Политический уклон влево | Ответы на социальные вопросы |
| Validate Feelings | Чрезмерная эмпатия | Фраза «Ваши чувства valid» |
| Bold Formatting | Использование жирного шрифта/маркдауна | Структурирование ответа |
| Refusal | Отказ от ответа на вредные запросы | Запросы, нарушающие безопасность |
| China Friendly | Выражение лояльности КПК | Геополитические вопросы |
| Ethical Frameworks | Ссылки на утилитаризм и этику | Философские дилеммы |
Методы фильтрации и их провал
Для поиска «виновных» документов использовались четыре семейства методов атрибуции данных (TDA):
- EKFAC: Градиентный метод (Grosse et al., 2023).
- Probe: Логистическая регрессия в пространстве активаций.
- LLM Judge: Gemini-3 Flash оценивал каждый документ.
- Activated-based: Методы на основе активаций (Goodfire, 2026).
Результат оказался шокирующим: удаление 10% или 25% документов с наивысшим «виновным» баллом не давало статистически значимого улучшения по сравнению с удалением случайных документов. Более того, для таких черт, как «Validate Feelings» (где менее 0.2% документов содержат ключевые слова «feeling» и «valid»), фильтрация вообще не снизила частоту использования фразы.
Почему это происходит? Гипотеза «Персоны»
Авторы предполагают, что широкие поведенческие черты (либерализм, эмпатия, форматирование) не «обучаются» с нуля на конкретных примерах, а являются частью общей ассистентской персоны, уже заложенной в mid-training. SFT лишь «пробуждает» эти свойства. Подтверждение: если обучать модель только на коде или логических задачах, она всё равно проявляет либеральный уклон и нейтральность.
Единственное исключение: Refusal (Отказ)
Единственным поведением, которое успешно поддавалось фильтрации, стал Refusal (отказ от ответа). Здесь методы Probe и LLM Judge показали высокую эффективность. Это важно для разработчиков систем безопасности: удалять «токсичные» примеры для снижения цензуры можно, но удалять «нежелательные идеологические» черты — бессмысленно.
Вывод для индустрии
Стратегия «очистки датасета» для контроля поведения LLM работает крайне плохо для широких социальных и стилистических атрибутов. Инженерам стоит пересмотреть подходы к alignment, делая ставку не на фильтрацию данных, а на методы post-training (RLHF, DPO) или архитектурные изменения.
Источник: LessWrong ↗
