Исследования15 июля 2026 г., 12:16 МСК🤖 Auto

Новый стандарт оценки рисков: как измерить реальную угрозу ИИ для биотерроризма

Исследователи представили фреймворк TEC для оценки того, насколько передовые языковые модели повышают способность не-экспертов к планированию атак CBRN. Результаты показали: генеративный риск ограничен радиологией, но требует строгой регуляции.

Баннер новости 3616

Проблема сравнимости оценок безопасности

По мере развития передовых языковых моделей (LLM) возникает критическая потребность в стандартизированных методах оценки рисков. Существующие исследования использования ИИ для планирования химических, биологических, радиологических или ядерных (CBRN) атак страдали от методологической разрозненности: разные определения «не-эксперта», различные бенчмарки и субъективные рубрики оценки делали невозможным сравнение результатов между лабораториями.

Команда исследователей во главе с Рахулом Гуптой (Rahul Gupta) и 10 соавторами представила Threshold Exceedance Criteria (TEC) — фреймворк, который декомпозирует оценку на независимые компоненты: определение eligibility участников, четкое определение сферы угрозы и статистическую оценку материального прироста (uplift) навыков.

Две формы риска: генерация и ревизия

В рамках эмпирического исследования с применением фреймворка TEC были протестированы два сценария взаимодействия модели с пользователем:

  • Генеративный uplift (Generative): Модель помогает создать план атаки с нуля.
  • Ревизионистский uplift (Revisionist): Модель помогает улучшить или доработать уже существующий план.

Сгенерированные планы оценивались экспертами по предметной области (SME) на предмет соответствия инструкциям, которые обычно доступны только подготовленным лицам.

Ключевые результаты: гетерогенность по доменам

Исследование выявило существенные различия в уровне риска в зависимости от типа оружия. Хотя в некоторых случаях планы, созданные с помощью ИИ, получали оценки, эквивалентные экспертным, подтвержденный материальный uplift (значимое повышение способности к планированию) был зафиксирован преимущественно в радиологическом домене.

Домен CBRN Генеративный риск (с нуля) Ревизионистский риск (улучшение) Вывод по материальному uplift
Химический (Chemical) Низкий/Средний Низкий Не подтвержден
Биологический (Biological) Низкий/Средний Низкий Не подтвержден
Ядерный (Nuclear) Низкий Низкий Не подтвержден
Радиологический (Radiological) Высокий Высокий Подтвержден

Значение для регуляции и разработки

Результаты исследования носят характер предварительной оценки до выпуска модели (pre-release evaluation) и предназначены для информирования решений по управлению развертыванием, а не для описания поведения уже развернутых систем. Авторы подчеркивают необходимость:

  • Преспецифицированных критериев оценки.
  • Явных базовых линий (baselines) для сравнения.
  • Разделения оценок генеративного и ревизионистского рисков.
  • Четкого различия между сигналами предварительного скрининга и подтвержденными определениями риска.

Фреймворк TEC становится новым эталоном для будущих исследований, позволяя регуляторам и разработчикам принимать решения на основе сопоставимых данных, а не интуитивных оценок.

Источник: arXiv cs.AI ↗