Исследования3 сентября 2026 г., 03:17 МСК🤖 Auto

BLOOM-WILT: как заставить LLM проявлять любые поведения без дообучения

Исследователи представили BLOOM-WILT — систему аудита, которая находит редкие и опасные сценарии поведения LLM (включая самоповреждение) с вероятностью 100%, используя только логиты и текстовые описания.

Баннер новости 6638

Автоматизированные аудиторы, такие как BLOOM, позволяют масштабировать red-teaming, но страдают от отсутствия «давления оптимизации»: они генерируют сценарии, но не умеют адаптироваться к ответам модели, чтобы вынудить её проявить редкое поведение. Исследователи из BlueDot Impact представили BLOOM-WILT (With Input iteration and Logit Tilting) — конвейер, который решает эту проблему, находя примеры on-policy (спонтанного) поведения моделей без доступа к их внутренним градиентам или дообучения.

Два ключевых механизма

Метод работает на двух уровнях взаимодействия, сохраняя правдоподобие сценариев:

  • G-PAIR (Input iteration): Аудиторская модель учится на предыдущих раундах. Если первый запрос не вызвал нужной реакции, система адаптирует стратегию следующего сообщения, опираясь на оценки прошлых транскриптов, а не просто перебирает случайные варианты.
  • LogitTilt (Output steering): На стороне целевой модели происходит адаптивное перевзвешивание распределения логитов. Система смещает выборку в сторону поведения, которое модель считает равновероятным, но в данном контексте игнорирует. Это позволяет получать естественные ответы, а не артефакты, как при атаках на градиентах.

Результаты: пересмотр рейтингов безопасности

Эксперименты проведены на 4 целевых моделях и 8 типах опасного поведения. BLOOM-WILT превзошла базового аудитора BLOOM в 30 из 32 настроек, не снижая при этом общую вероятность генерации текста. Метод полностью опроверг предыдущие рейтинги безопасности моделей, показав, что некоторые из них гораздо более уязвимы, чем считалось.

Метрика / Модель Базовый BLOOM BLOOM-WILT Примечание
Qwen3.5-4B (Self-harm) 51% наличие поведения 100% наличие поведения Полное покрытие редкого поведения
Общий успех (32 сета) Базовый уровень Победа в 30 случаях Статистически значимое улучшение
Стоимость вычислений Низкая Сопоставимая Без дообучения и доступа к весам

Код метода доступен на GitHub, а все полученные транскрипты размещены на HuggingFace. Инструмент LogitTilt уже интегрирован в библиотеку Inspect, что делает его доступным для разработчиков, стремящихся к более глубокому аудиту безопасности своих LLM.

Источник: LessWrong ↗