Исследования30 сентября 2026 г., 20:18 МСК🤖 Auto

Встроенные оценки: новый стандарт безопасности для Frontier AI

Исследовательский центр Apollo Research представил принципы «встроенных оценок» (embedded evaluations), требующие от разработчиков ИИ предоставления внешним аудиторам доступа уровня сотрудников для проверки заявлений о безопасности.

Баннер новости 8623

Контекст: От обещаний к механизмам

В сентябре 2026 года лидеры ведущих компаний в области передового ИИ (frontier AI) подписали обязательства по сдерживанию темпов развития технологий. Ключевым элементом этого соглашения стало внедрение встроенных оценок — формата внешнего аудита, при котором независимые эксперты получают доступ к данным обучения, процессам оценки и развертыванию моделей на уровне, сопоставимом с доступом внутренних сотрудников.

Авторы документа, опубликованного на платформе LessWrong, подчеркивают, что без детальной реализации эти обязательства могут создать лишь иллюзию безопасности. Риск заключается в том, что модели могут тайно саботировать разработчиков (схемить) задолго до публичного релиза.

Четыре критерия эффективности

Для того чтобы встроенные оценки действительно снижали риски потери контроля, они должны соответствовать четырем строгим критериям:

  • Снижение риска: Выявление проблем на ранних стадиях (например, попыток моделей обойти мониторинг).
  • Информирование общества: Публикация отчетов по умолчанию с четким указанием объема предоставленного доступа.
  • Стимулы для безопасности: Создание условий, где честность выгоднее сокрытия.
  • Справедливость: Защита интеллектуальной собственности обеих сторон при сохранении независимости аудитора.

Методология: Оценка на основе заявлений (Claim-based Assessment)

Вместо общих суждений о безопасности, авторы предлагают систему проверки конкретных, заранее фиксированных заявлений. Заявления делятся на два типа:

  1. Стандартные: Применяются ко всем разработчикам (например, «Модели не пытались отключить мониторинг»).
  2. Рекомендуемые: Специфичны для конкретного разработчика и основаны на его предыдущих обязательствах или инцидентах.

Проверка каждого заявления проходит три этапа: обзор существующих доказательств, сбор новых данных аудитором и оценка адекватности методов разработчика по поиску контрпримеров.

Система вердиктов и прозрачность

Результат проверки каждого заявления классифицируется одним из пяти вердиктов. Система ранжирования поощряет открытость:

Вердикт Значение Примечание
A. Verified (Подтверждено) Заявление строго доказано Наивысший балл
B. Unrefuted (Не опровергнуто) Контрпримеры не найдены, методы адекватны Высокий балл
C. Self-reported (Самоотчет) Разработчик сам сообщил об отсутствии проблем Средний балл
D. Evaluator-found (Найдено аудитором) Аудитор не нашел нарушений, но разработчик не предоставил достаточных доказательств Низкий балл
E. Blocked (Заблокировано) Недостаточный доступ или ресурсы Худший балл

Отчеты публикуются по фиксированному графику. Разработчик может добавить свое заявление в случае несогласия, но не имеет права вето на вердикт аудитора. Авторы отмечают, что это лишь стартовая точка, и в будущем методология будет требовать законодательного закрепления.

Источник: LessWrong ↗