От «проб и ошибок» к научным гарантиям
Основатель RESI Адам Холцман (Adam Holzman) покинул OpenAI, чтобы создать некоммерческую организацию в Кембридже, штат Массачусетс. Главная идея института — отказ от метода «fly-fix-fly» (летай-почини-летай), который доминировал в ранней авиации и криптографии. Вместо этого RESI предлагает подход safe-by-design (безопасность через проектирование): создание систем, чьи свойства безопасности выводятся из архитектуры, протоколов и механизмов стимулирования, а не из эмпирических наблюдений.
Аналогия проста: как архитекторы понимают физику материалов, чтобы строить устойчивые башни из спагетти, так и исследователи RESI хотят понять фундаментальные свойства ИИ, чтобы гарантировать их надежность до развертывания.
Команда: элита криптографии и теории игр
В отличие от многих стартапов, RESI опирается на строгие математические дисциплины. Сооснователями института стали Шафи Голдвассер (Shafi Goldwasser, изобретатель доказательств с нулевым разглашением) и Винод Вайкунтанатан (Vinod Vaikuntanathan, ведущий криптограф MIT). В команду вошли эксперты по компонуемой безопасности, теории выравнивания, механизмам дизайна и безопасному управлению роботизированными системами.
Ключевые направления исследований
RESI фокусируется на разработке теорий и инструментов для анализа продвинутых ИИ-систем до их запуска. Исследователи работают над тем, чтобы определить, какие свойства безопасности достижимы, а какие — нет, и при каких условиях они сохраняются.
| Направление | Суть задачи |
|---|---|
| Верификация моделей | Проверка свойств и выходов моделей до развертывания |
| Криптография и кибербезопасность | Защита от атак, стеганография, верифицированное делегирование |
| Игровые основы безопасности | Анализ стимулов, алгоритмического сговора и поведения агентов |
| Юридическое выравнивание | Интеграция правовых норм в архитектуру ИИ |
| Квантовые эффекты | Использование квантовой физики для повышения безопасности ИИ |
Три главные проблемы, которые решает институт
- Роль стимулов: Как стимулы продолжают влиять на поведение систем по мере роста их интеллекта? (Пример: наклейки мотивируют детей, но не взрослых).
- Осторожность ИИ: Как спроектировать системы, которые действуют только тогда, когда результаты (включая взаимодействие множества ИИ) заведомо полезны?
- Возможность отключения: Как сохранить способность «выключить» систему в широком диапазоне сред, при росте возможностей и самоизменении?
Почему это важно сейчас
RESI позиционирует себя как ответ на растущую тревожность вокруг ИИ. Холцман отмечает, что ИИ — это программа, которую можно копировать, переписывать и формально обосновывать. Институт стремится найти «золотую середину» между безопасностью и способностью: например, может ли ИИ быть суперчеловеческим в исследовании рака, но быть строго ограниченным в других аспектах? Результаты исследований RESI предназначены для использования фронтенд-лабораториями и регуляторами.
Источник: LessWrong ↗
