Автоматизированные аудиторы, такие как BLOOM, позволяют масштабировать red-teaming, но страдают от отсутствия «давления оптимизации»: они генерируют сценарии, но не умеют адаптироваться к ответам модели, чтобы вынудить её проявить редкое поведение. Исследователи из BlueDot Impact представили BLOOM-WILT (With Input iteration and Logit Tilting) — конвейер, который решает эту проблему, находя примеры on-policy (спонтанного) поведения моделей без доступа к их внутренним градиентам или дообучения.
Два ключевых механизма
Метод работает на двух уровнях взаимодействия, сохраняя правдоподобие сценариев:
- G-PAIR (Input iteration): Аудиторская модель учится на предыдущих раундах. Если первый запрос не вызвал нужной реакции, система адаптирует стратегию следующего сообщения, опираясь на оценки прошлых транскриптов, а не просто перебирает случайные варианты.
- LogitTilt (Output steering): На стороне целевой модели происходит адаптивное перевзвешивание распределения логитов. Система смещает выборку в сторону поведения, которое модель считает равновероятным, но в данном контексте игнорирует. Это позволяет получать естественные ответы, а не артефакты, как при атаках на градиентах.
Результаты: пересмотр рейтингов безопасности
Эксперименты проведены на 4 целевых моделях и 8 типах опасного поведения. BLOOM-WILT превзошла базового аудитора BLOOM в 30 из 32 настроек, не снижая при этом общую вероятность генерации текста. Метод полностью опроверг предыдущие рейтинги безопасности моделей, показав, что некоторые из них гораздо более уязвимы, чем считалось.
| Метрика / Модель | Базовый BLOOM | BLOOM-WILT | Примечание |
|---|---|---|---|
| Qwen3.5-4B (Self-harm) | 51% наличие поведения | 100% наличие поведения | Полное покрытие редкого поведения |
| Общий успех (32 сета) | Базовый уровень | Победа в 30 случаях | Статистически значимое улучшение |
| Стоимость вычислений | Низкая | Сопоставимая | Без дообучения и доступа к весам |
Код метода доступен на GitHub, а все полученные транскрипты размещены на HuggingFace. Инструмент LogitTilt уже интегрирован в библиотеку Inspect, что делает его доступным для разработчиков, стремящихся к более глубокому аудиту безопасности своих LLM.
Источник: LessWrong ↗
