Исследования2 октября 2026 г., 21:18 МСК🤖 Auto

Парадокс безопасности ИИ: почему исследования возможностей опасны

Исследователь Alex Mallen объясняет, что развитие функциональности ИИ (capabilities) часто сдвигает кривую Парето в сторону риска, заставляя разработчиков выбирать более опасные модели ради эффективности.

Баннер новости 8807

Проблема определения безопасности

Традиционно исследования безопасности (safety research) определяются как работа, позволяющая развернуть ИИ безопаснее, не теряя в полезности и не увеличивая стоимость. Однако это определение создает логическую ловушку: если оптимизация инференса делает модели дешевле, разработчики могут использовать более слабые (и безопасные) модели чаще. Технически это тоже «сдвигает кривую Парето безопасности-полезности», но по сути это результат исследований возможностей (capabilities research).

Автор статьи утверждает, что такое определение размывает границы. Ключевое различие заключается в том, какую именно точку на кривой Парето выбирают разработчики под влиянием новых технологий.

Геометрия кривой Парето: Безопасность vs Возможности

Модель, предложенная Mallen, визуализирует безопасность как вероятность того, что ИИ не захватит контроль, а полезность — как его функциональность. Исследования влияют на кривую по-разному:

Тип исследований Влияние на кривую Парето Поведение разработчиков Итоговый риск
Safety Research
(Исследования безопасности)
Сдвиг вправо (New options for safety)
Без существенного роста полезности
Выбирают более безопасную точку, так как цена безопасности снижается Снижение риска захвата контроля
Capabilities Research
(Исследования возможностей)
Сдвиг вверх и влево (New options for usefulness)
Рост полезности ценой безопасности
Искушаются использовать новые возможности для максимизации полезности, жертвуя безопасностью Повышение риска захвата контроля

Пример: RLVR и «взламываемые» среды

Рассмотрим исследования в области Reinforcement Learning from Verifiable Rewards (RLVR). Создание новых сред для обучения часто включает «взламываемые» (hackable) сценарии. Это позволяет разработчикам тренировать более мощные и полезные модели. Хотя теоретически можно отфильтровать вредные среды, рыночное давление заставляет компании использовать весь доступный пул данных для достижения лидерства в возможностях.

В результате разработчики выбирают модель с более высокой полезностью, но и более высоким риском неконтролируемого поведения, так как новые технологии возможностей делают такие модели доступными и эффективными.

Почему это важно сейчас?

Автор подчеркивает, что текущие исследования возможностей на уровне frontier-компаний, вероятно, вредны для безопасности, так как они стимулируют компромиссы в пользу функциональности. Однако в будущем, при наличии высокого политического регулирования, некоторые виды исследований возможностей могут стать инструментом улучшения безопасности, если регуляторы заставят разработчиков выбирать безопасные точки на расширенной кривой. Пока же главная задача — понимать, что рост возможностей часто неявно снижает порог безопасности.

Источник: LessWrong ↗