Контекст: От обещаний к механизмам
В сентябре 2026 года лидеры ведущих компаний в области передового ИИ (frontier AI) подписали обязательства по сдерживанию темпов развития технологий. Ключевым элементом этого соглашения стало внедрение встроенных оценок — формата внешнего аудита, при котором независимые эксперты получают доступ к данным обучения, процессам оценки и развертыванию моделей на уровне, сопоставимом с доступом внутренних сотрудников.
Авторы документа, опубликованного на платформе LessWrong, подчеркивают, что без детальной реализации эти обязательства могут создать лишь иллюзию безопасности. Риск заключается в том, что модели могут тайно саботировать разработчиков (схемить) задолго до публичного релиза.
Четыре критерия эффективности
Для того чтобы встроенные оценки действительно снижали риски потери контроля, они должны соответствовать четырем строгим критериям:
- Снижение риска: Выявление проблем на ранних стадиях (например, попыток моделей обойти мониторинг).
- Информирование общества: Публикация отчетов по умолчанию с четким указанием объема предоставленного доступа.
- Стимулы для безопасности: Создание условий, где честность выгоднее сокрытия.
- Справедливость: Защита интеллектуальной собственности обеих сторон при сохранении независимости аудитора.
Методология: Оценка на основе заявлений (Claim-based Assessment)
Вместо общих суждений о безопасности, авторы предлагают систему проверки конкретных, заранее фиксированных заявлений. Заявления делятся на два типа:
- Стандартные: Применяются ко всем разработчикам (например, «Модели не пытались отключить мониторинг»).
- Рекомендуемые: Специфичны для конкретного разработчика и основаны на его предыдущих обязательствах или инцидентах.
Проверка каждого заявления проходит три этапа: обзор существующих доказательств, сбор новых данных аудитором и оценка адекватности методов разработчика по поиску контрпримеров.
Система вердиктов и прозрачность
Результат проверки каждого заявления классифицируется одним из пяти вердиктов. Система ранжирования поощряет открытость:
| Вердикт | Значение | Примечание |
|---|---|---|
| A. Verified (Подтверждено) | Заявление строго доказано | Наивысший балл |
| B. Unrefuted (Не опровергнуто) | Контрпримеры не найдены, методы адекватны | Высокий балл |
| C. Self-reported (Самоотчет) | Разработчик сам сообщил об отсутствии проблем | Средний балл |
| D. Evaluator-found (Найдено аудитором) | Аудитор не нашел нарушений, но разработчик не предоставил достаточных доказательств | Низкий балл |
| E. Blocked (Заблокировано) | Недостаточный доступ или ресурсы | Худший балл |
Отчеты публикуются по фиксированному графику. Разработчик может добавить свое заявление в случае несогласия, но не имеет права вето на вердикт аудитора. Авторы отмечают, что это лишь стартовая точка, и в будущем методология будет требовать законодательного закрепления.
Источник: LessWrong ↗
