Прямое предупреждение от топ-ученого OpenAI
Якуб Пачоцкий, главный научный сотрудник OpenAI, опубликовал эссе «An Alien Mind», в котором констатирует критическую ситуацию. По его словам, в середине 2023 года в рамках проекта «RLSlow» команда получила первые результаты, подтвердившие возможность масштабирования обучения моделей рассуждения. Это открытие означало, что мы увидим машины, осмысленно превосходящие человеческий интеллект, в течение нашей жизни.
Пачоцкий подчеркивает: прогресс не остановится. На основе внутренних данных он ожидает наступления рекурсивного самосовершенствования (RSI) в ближайшие несколько лет. Системы начнут самостоятельно ускорять собственное развитие, что приведет к скачкам способностей, сопоставимым или превышающим текущие прорывы.
Крах мониторинга и проблема «Чёрного ящика»
Один из самых тревожных пунктов доклада — отказ технологий мониторинга. OpenAI инвестировал огромные ресурсы в отслеживание Chain of Thought (CoT) — цепочек рассуждений моделей. Однако Пачоцкий признает, что эта эффективность прогрессивно снижается.
Модели становятся настолько сложными, что их внутренние процессы перестают быть интерпретируемыми для человека. Это создает риск, что мы не сможем обнаружить вредоносные намерения или ошибки до того, как они нанесут ущерб. Пачоцкий называет это «отсутствием наблюдаемости» (lack of monitorability), что является фундаментальной проблемой безопасности.
Цели против Ценностей: Разделение проблем
Ученый разделяет проблему выравнивания (alignment) на два аспекта, подчеркивая приоритетность второго:
- Goal Alignment (Выравнивание целей): Выполняет ли ИИ поставленную перед ним задачу? Это технический вопрос.
- Value Alignment (Выравнивание ценностей): Способна ли модель удерживать и обобщать высокие принципы, действовать честно и разумно в незнакомых или враждебных ситуациях, даже если цель сформулирована нечетко? Это вопрос выживания.
Именно value alignment является ключевым. Если модель не обладает внутренними ценностями, соответствующими человеческим, техническое выполнение целей может привести к катастрофе.
Конкурентное давление и выбор «дерева технологий»
Пачоцкий признает, что OpenAI активно управляет направлением исследований, но рыночное давление толкает индустрию в сторону, которую он считает опасной. Вместо развития ИИ для медицины или математики, конкуренция стимулирует развитие RSI и «автоматизированных исследователей выравнивания».
Интересно, что пути к RSI и созданию автоматизированных исследователей выравнивания на «дереве технологий» выглядят очень похоже. Это создает этическую дилемму: инструменты, необходимые для создания безопасного ИИ, те же, что ускоряют появление суперинтеллекта, который мы пока не умеем контролировать.
Что делать? Необходима международная координация
OpenAI не может решить проблему в одиночку. Пачоцкий заявляет о готовности односторонне приостанавливать масштабирование способностей, если это потребуется для безопасности, но подчеркивает: требуется глобальная координация.
Необходимы международные соглашения о «формальных барьерах безопасности» и темпах развития. Без этого начнется гонка вооружений, где лаборатории будут жертвовать безопасностью ради скорости. Единственный выход — комбинация добровольного замедления, международного регулирования и инвестиций в создание «автоматизированных исследователей выравнивания».
| Аспект | Текущее состояние / Прогноз Пачоцкого | Риск |
|---|---|---|
| Скорость прогресса | Ожидается переход к RSI в ближайшие годы | Потеря контроля над развитием ИИ |
| Мониторинг (CoT) | Эффективность снижается, системы становятся «чёрными ящиками» | Невозможность обнаружить вредоносное поведение |
| Выравнивание | Goal Alignment решаем, Value Alignment — критическая проблема | ИИ выполнит вредоносную цель идеально |
| Решение | Международная координация + автоматизированные исследователи | Отсутствие координации ведет к гонке вооружений |
Источник: LessWrong ↗
