Исследования21 июля 2026 г., 05:17 МСК🤖 Auto

AIKraft: Как унифицировать пороги безопасности ИИ

Исследователи предлагают методологию для согласования порогов безопасности ИИ, чтобы избежать «гонки ко дну» в стандартах защиты.

Баннер новости 3999

Проблема разрозненных стандартов

Крупнейшие компании, разрабатывающие передовые модели ИИ (Frontier AI), публикуют собственные пороги безопасности, которые существенно различаются. Это создает серьезные барьеры для независимой верификации: третьим сторонам сложно определить, был ли пересечен тот или иной порог, а также сравнить требования разных игроков рынка. Отсутствие единых минимальных стандартов ведет к несогласованному снижению рисков и потенциальной «гонке ко дну» в вопросах безопасности.

Методология гармонизации

Авторы исследования (Wilber Sean Anterola, Matthew Ball, Luis F. Lafuerza, Markov Grey) разработали методологию для вывода согласованных порогов по трем ключевым направлениям рисков. Подход базируется на двух различных принципах в зависимости от типа угрозы:

  • Риски misuse (злоупотребления): Для киберугроз и биологических рисков ключевой метрикой выступает ожидаемый вред (expected harm). Используется явное моделирование рисков, учитывающее каналы передачи угрозы и условия выпуска модели.
  • Автоматизированные ИИ-исследования (R&D): Порог здесь основан не на оценке вреда, а на наблюдаемой скорости прогресса ИИ.

Сравнительный анализ подходов

Предложенная методология расширяет предыдущие работы в области безопасности ИИ. Авторы подчеркивают существующие эмпирические пробелы и ограничения текущих подходов к оценке рисков.

Домен риска Ключевая метрика Метод оценки
Злоупотребление (Misuse) Ожидаемый вред Моделирование каналов риска и условий выпуска
ИИ-исследования (R&D) Скорость прогресса Наблюдение за темпами развития технологий

Значение для индустрии

Внедрение унифицированных порогов позволит создать прозрачную систему верификации, где регуляторы и общественность смогут объективно оценивать уровень безопасности новых моделей. Это критически важно для предотвращения инцидентов, связанных с созданием биологического оружия или кибератак, а также для контроля над автономным развитием ИИ-систем.

Источник: arXiv cs.AI ↗