Проблема определения безопасности
Традиционно исследования безопасности (safety research) определяются как работа, позволяющая развернуть ИИ безопаснее, не теряя в полезности и не увеличивая стоимость. Однако это определение создает логическую ловушку: если оптимизация инференса делает модели дешевле, разработчики могут использовать более слабые (и безопасные) модели чаще. Технически это тоже «сдвигает кривую Парето безопасности-полезности», но по сути это результат исследований возможностей (capabilities research).
Автор статьи утверждает, что такое определение размывает границы. Ключевое различие заключается в том, какую именно точку на кривой Парето выбирают разработчики под влиянием новых технологий.
Геометрия кривой Парето: Безопасность vs Возможности
Модель, предложенная Mallen, визуализирует безопасность как вероятность того, что ИИ не захватит контроль, а полезность — как его функциональность. Исследования влияют на кривую по-разному:
| Тип исследований | Влияние на кривую Парето | Поведение разработчиков | Итоговый риск |
|---|---|---|---|
| Safety Research (Исследования безопасности) |
Сдвиг вправо (New options for safety) Без существенного роста полезности |
Выбирают более безопасную точку, так как цена безопасности снижается | Снижение риска захвата контроля |
| Capabilities Research (Исследования возможностей) |
Сдвиг вверх и влево (New options for usefulness) Рост полезности ценой безопасности |
Искушаются использовать новые возможности для максимизации полезности, жертвуя безопасностью | Повышение риска захвата контроля |
Пример: RLVR и «взламываемые» среды
Рассмотрим исследования в области Reinforcement Learning from Verifiable Rewards (RLVR). Создание новых сред для обучения часто включает «взламываемые» (hackable) сценарии. Это позволяет разработчикам тренировать более мощные и полезные модели. Хотя теоретически можно отфильтровать вредные среды, рыночное давление заставляет компании использовать весь доступный пул данных для достижения лидерства в возможностях.
В результате разработчики выбирают модель с более высокой полезностью, но и более высоким риском неконтролируемого поведения, так как новые технологии возможностей делают такие модели доступными и эффективными.
Почему это важно сейчас?
Автор подчеркивает, что текущие исследования возможностей на уровне frontier-компаний, вероятно, вредны для безопасности, так как они стимулируют компромиссы в пользу функциональности. Однако в будущем, при наличии высокого политического регулирования, некоторые виды исследований возможностей могут стать инструментом улучшения безопасности, если регуляторы заставят разработчиков выбирать безопасные точки на расширенной кривой. Пока же главная задача — понимать, что рост возможностей часто неявно снижает порог безопасности.
Источник: LessWrong ↗
