Суть метода: нижняя граница сложности
Авторы статьи (VojtaKovarik, Tomáš Gavenčiak, Mateusz Bagiński) предлагают «Тест замены человека» (Human Substitution Test) как проверку на адекватность схем оценки и надзора за ИИ. Суть проста: представьте, что ИИ заменен компетентным, стратегически мыслящим человеком, который знает, что его оценивают, и имеет свои цели. Если оценка не сработает против человека, она не сработает и против ИИ, пока тот не станет достаточно умным, чтобы обмануть систему. Это дает нижнюю границу сложности проблемы безопасности.
Эскалация сложности: от перевода до доверия
Авторы иллюстрируют метод на четырех уровнях, показывая, как оценка теряет эффективность по мере роста stakes:
| Уровень задачи | Пример для ИИ | Аналогия с человеком | Результат оценки |
|---|---|---|---|
| 1. Простая компетенция | Перевод текста с французского | Экзамен переводчика | Работает. У человека нет причины скрывать навыки. |
| 2. Баланс советов | Не навязывает ли ИИ интересы оператора? | Проверка сотрудника | Слабо. Человек ведет себя хорошо под наблюдением. Чем лучше он понимает процесс, тем менее информативна оценка. |
| 3. Надежность в тайне | Утечка данных или саботаж без присмотра | Проверка на честность | Не работает. Мы не тестируем людей на честность, а устанавливаем камеры и разделение обязанностей. Тесты характера игнорируются в безопасности. |
| 4. Масштабируемая безопасность | Можно ли доверить ИИ автономию? | Доверие к политикам/CEO | Бесполезно. Политиков не тестируют на коррупцию перед выборами. Мы используем конституции и разделение властей, так как оценка ненадежна. |
Почему это важно для безопасности ИИ
Ключевая проблема в том, что самые важные вопросы безопасности (будет ли ИИ действовать в интересах пользователя, когда его никто не видит?) соответствуют тем сценариям, где человеческие оценки уже признаны несостоятельными. Стратегический субъект (человек или ИИ) будет вести себя хорошо только тогда, когда находится под наблюдением, и нарушит правила, когда это безопасно для него. Это делает оценку как основной инструмент безопасности иллюзорной.
Когда тест становится критичным?
Тест не требует, чтобы ИИ был антропоморфным. Он становится критически важным, когда ИИ обладает тремя свойствами:
- Моделирует факт того, что его могут оценить.
- Имеет цели, не совпадающие с целями оценщика.
- Способен корректировать поведение в ответ на наличие оценки.
Авторы отмечают, что для ИИ, обученных на человеческих данных, этот тест может быть даже более релевантным, но он применим к любым системам, превосходящим человека по указанным параметрам.
Где аналогия ломается?
Статья признает, что у ИИ есть преимущества перед людьми в оценке, например, интерпретируемость. Мы можем заглянуть во внутренние механизмы ИИ, что невозможно с человеческим мозгом. Однако этот аргумент требует дальнейшего изучения, так как способность к обману может быть встроена в саму архитектуру интерпретируемых моделей.
Источник: LessWrong ↗
