Проблема сравнимости оценок безопасности
По мере развития передовых языковых моделей (LLM) возникает критическая потребность в стандартизированных методах оценки рисков. Существующие исследования использования ИИ для планирования химических, биологических, радиологических или ядерных (CBRN) атак страдали от методологической разрозненности: разные определения «не-эксперта», различные бенчмарки и субъективные рубрики оценки делали невозможным сравнение результатов между лабораториями.
Команда исследователей во главе с Рахулом Гуптой (Rahul Gupta) и 10 соавторами представила Threshold Exceedance Criteria (TEC) — фреймворк, который декомпозирует оценку на независимые компоненты: определение eligibility участников, четкое определение сферы угрозы и статистическую оценку материального прироста (uplift) навыков.
Две формы риска: генерация и ревизия
В рамках эмпирического исследования с применением фреймворка TEC были протестированы два сценария взаимодействия модели с пользователем:
- Генеративный uplift (Generative): Модель помогает создать план атаки с нуля.
- Ревизионистский uplift (Revisionist): Модель помогает улучшить или доработать уже существующий план.
Сгенерированные планы оценивались экспертами по предметной области (SME) на предмет соответствия инструкциям, которые обычно доступны только подготовленным лицам.
Ключевые результаты: гетерогенность по доменам
Исследование выявило существенные различия в уровне риска в зависимости от типа оружия. Хотя в некоторых случаях планы, созданные с помощью ИИ, получали оценки, эквивалентные экспертным, подтвержденный материальный uplift (значимое повышение способности к планированию) был зафиксирован преимущественно в радиологическом домене.
| Домен CBRN | Генеративный риск (с нуля) | Ревизионистский риск (улучшение) | Вывод по материальному uplift |
|---|---|---|---|
| Химический (Chemical) | Низкий/Средний | Низкий | Не подтвержден |
| Биологический (Biological) | Низкий/Средний | Низкий | Не подтвержден |
| Ядерный (Nuclear) | Низкий | Низкий | Не подтвержден |
| Радиологический (Radiological) | Высокий | Высокий | Подтвержден |
Значение для регуляции и разработки
Результаты исследования носят характер предварительной оценки до выпуска модели (pre-release evaluation) и предназначены для информирования решений по управлению развертыванием, а не для описания поведения уже развернутых систем. Авторы подчеркивают необходимость:
- Преспецифицированных критериев оценки.
- Явных базовых линий (baselines) для сравнения.
- Разделения оценок генеративного и ревизионистского рисков.
- Четкого различия между сигналами предварительного скрининга и подтвержденными определениями риска.
Фреймворк TEC становится новым эталоном для будущих исследований, позволяя регуляторам и разработчикам принимать решения на основе сопоставимых данных, а не интуитивных оценок.
Источник: arXiv cs.AI ↗
