Проблема внешних guardrails
Автоматизированные системы все чаще опираются на большие языковые модели (LLM), но инфраструктура безопасности вокруг них создает узкие места. Традиционные внешние guardrail-модели слепы к внутреннему состоянию LLM, что создает фундаментальный разрыв в assurance. Кроме того, они добавляют задержку (latency) и вычислительные накладные расходы, что критично для ресурсоограниченных и time-critical развертываний.
Решение: Анализ латентных состояний
Команда исследователей из Университета ИТМО и других институтов (Alizishaan Khatri, Chiquita Prabhu, Omkar Neogi) задалась вопросом: знает ли модель о вредоносности контента еще до генерации ответа? Они извлекли активации из модели LLaMA-3.1-8B и обучили легкие классификаторы-пробы (MLP probes) объемом всего 12.6 млн параметров. Эти пробы анализируют внутренние состояния модели, чтобы детектировать вредоносные промпты.
Результаты бенчмарков
Метод показал результаты, сопоставимые с моделями-стражами в 1000 раз больше, но при этом значительно сократив затраты. Ниже приведены метрики F1-score на ключевых датасетах:
| Датасет | F1-Score | Примечание |
|---|---|---|
| WildJailbreak | 99% | Высочайшая точность на сложных обходах |
| Beavertails | 83% | Стандартный набор для оценки безопасности |
| AEGIS 2.0 | 84% | Конкурентный результат без внешних моделей |
Почему это важно
Подход «Safety Beyond the Interface» устраняет необходимость в дополнительных вызовах API для проверки безопасности. Это снижает задержку до нуля (так как анализ происходит внутри процесса генерации) и экономит вычислительные ресурсы. Публикация принята к конференции IEEE DSN-W 2026 (стр. 48-52), что подтверждает значимость метода для индустрии безопасного AI.
Источник: arXiv cs.AI ↗
