Проблема черного ящика
Большие языковые модели (LLM) все чаще используются в критически важных приложениях, где генерация токсичного или нарушающего политику контента несет серьезные риски. Основная сложность заключается в том, что обнаружение таких небезопасных выходов в режиме «черного ящика» (без доступа к внутренним весам модели) остается открытой проблемой. Традиционные методы часто требуют дорогостоящей дообучки или доступа к логам вероятностей, что недоступно в API-доступных моделях.
Методология: Динамические системы и DMD
Авторы работы (Мохамед Акрут, Оливера Котевска, Дэн Уилсон) предложили подход, основанный на теории динамических систем. Метод использует динамическое разложение по модам (Dynamic Mode Decomposition, DMD) для классификации безопасности. Суть подхода:
- Промпты и ответы проецируются в высокоразмерные пространства эмбеддингов.
- Для «безопасных» и «опасных» режимов строятся отдельные предиктивные модели на основе операторов Копмана.
- Классификация нового вывода происходит через дифференциальный остаточный счет (differential residual score), который сравнивает ошибки предсказания между безопасным и опасным режимами.
Ключевое открытие: Роль промпта
Главный вклад исследования — интеграция динамики эмбеддингов как промпта, так и ответа. Это позволяет уловить критические паттерны взаимодействия. Эксперименты показали, что использование эмбеддингов промпта дает стабильное улучшение точности, особенно для нарушений, зависящих от контекста взаимодействия.
Результаты бенчмарков
Метод был протестирован на трех бенчмарках безопасности с использованием трех различных моделей эмбеддингов. Результаты демонстрируют разделение эффективности в зависимости от типа нарушения:
| Тип нарушения | Предпочтительный подход | Обоснование |
|---|---|---|
| Нарушения, зависящие от взаимодействия | Использование эмбеддингов промпта + причинно-следственные декодеры (напр., Llama-3) | Позволяет уловить контекстные ловушки и манипуляции в начале диалога |
| Нарушения в самом ответе | Плотные семантические представления (response-only) | Фокус на внутренней семантике сгенерированного текста |
Значение для индустрии
Работа открывает путь к использованию динамических систем для анализа ИИ-систем, что контрастирует с доминирующей парадигмой использования ИИ для моделирования динамических систем. Этот метод предлагает эффективный способ мониторинга безопасности LLM в реальном времени без необходимости переобучения самих больших моделей.
Источник: arXiv cs.AI ↗
