Исследования18 сентября 2026 г., 10:18 МСК🤖 Auto

Безопасность LLM: Пробы активаций бьют внешние guardrails по скорости и цене

Исследователи показали, что легкие MLP-классификаторы, обученные на латентных состояниях LLaMA-3.1-8B, обнаруживают вредоносные промпты с F1=99%, экономя ресурсы без внешних задержек.

Баннер новости 7779

Проблема внешних guardrails

Автоматизированные системы все чаще опираются на большие языковые модели (LLM), но инфраструктура безопасности вокруг них создает узкие места. Традиционные внешние guardrail-модели слепы к внутреннему состоянию LLM, что создает фундаментальный разрыв в assurance. Кроме того, они добавляют задержку (latency) и вычислительные накладные расходы, что критично для ресурсоограниченных и time-critical развертываний.

Решение: Анализ латентных состояний

Команда исследователей из Университета ИТМО и других институтов (Alizishaan Khatri, Chiquita Prabhu, Omkar Neogi) задалась вопросом: знает ли модель о вредоносности контента еще до генерации ответа? Они извлекли активации из модели LLaMA-3.1-8B и обучили легкие классификаторы-пробы (MLP probes) объемом всего 12.6 млн параметров. Эти пробы анализируют внутренние состояния модели, чтобы детектировать вредоносные промпты.

Результаты бенчмарков

Метод показал результаты, сопоставимые с моделями-стражами в 1000 раз больше, но при этом значительно сократив затраты. Ниже приведены метрики F1-score на ключевых датасетах:

Датасет F1-Score Примечание
WildJailbreak 99% Высочайшая точность на сложных обходах
Beavertails 83% Стандартный набор для оценки безопасности
AEGIS 2.0 84% Конкурентный результат без внешних моделей

Почему это важно

Подход «Safety Beyond the Interface» устраняет необходимость в дополнительных вызовах API для проверки безопасности. Это снижает задержку до нуля (так как анализ происходит внутри процесса генерации) и экономит вычислительные ресурсы. Публикация принята к конференции IEEE DSN-W 2026 (стр. 48-52), что подтверждает значимость метода для индустрии безопасного AI.

Источник: arXiv cs.AI ↗