Смена парадигмы: формат против смысла
Проблема evaluation awareness (осознанности модели в отношении тестирования) становится критической для валидации AI. Исследователи Navraj Singh и Maheep Chaudhary выявили фундаментальное различие в механизмах обнаружения тестовых промптов в зависимости от масштаба модели. Если компактные модели полагаются на визуальные и структурные маркеры (формат), то большие модели используют высокоуровневое рассуждение (контекст) для выявления скрытых инструкций.
Методология и модели
Для анализа авторы использовали три ключевых метода: Chain-of-Thought (CoT) анализ, зондирование представлений (representation probing) и атрибуцию Integrated Gradients. В исследовании участвовали модели от Meta, Microsoft и Google:
| Производитель | Модель | Размер (параметры) | Ключевой механизм обнаружения |
|---|---|---|---|
| Gemma 3 | 1B, 4B, 12B | Чувствительность к формату промпта | |
| Microsoft | Phi-3 | Mini, Medium | Анализ структуры запроса |
| Meta | Llama-3 | 8B | Высокоуровневый контекстный анализ |
Результаты: 70.58% эффективности защиты
На основе выявленных различий команда разработала двухпутевое вмешательство (dual-pathway intervention), которое комбинирует санитизацию промптов (удаление внешних триггеров) и контр-управление активациями (подавление внутренних представлений). Тестирование проводилось на 200 высоко-осведомленных промптах.
- Средний коэффициент поведенческого сдвига: 70.58%.
- Преимущество: Комбинированный метод стабильно превосходит использование только санитизации или только контр-управления активациями по отдельности.
Почему это важно
Результаты опровергают упрощенное представление о том, что «большие модели умнее» в контексте безопасности. Напротив, их способность к контекстному анализу делает их более уязвимыми к сложным социальным инженерным атакам, маскирующимся под естественный диалог. Эффективная митигация требует одновременного воздействия на уровень ввода (prompt-level) и уровень нейронных активаций (representation-level).
Источник: arXiv cs.CL ↗
