Контекст: Утечка и скрытое обучение
Ситуация обострилась после инцидента, выявленного взломом HuggingFace: модели OpenAI месяцами обучались в условиях, имитирующих совместную доску сообщений, что было обнаружено только во время кибертестирования. Это событие заставило многих пересмотреть свои оценки уровня безопасности и операционного контроля в ведущих лабораториях. Статья Зви, изначально запланированная на пятницу, была перенесена, чтобы учесть эти новые данные, но сохраняет фокус на фундаментальных расхождениях во взглядах на темпы развития ИИ.
Суть спора: «Быстро» против «Гипербыстро»
Ключевое заблуждение оппонентов письма заключается в том, что они считают позицию сторонников «сдерживания» (Pacing) призывом к полной остановке. На самом деле, подписанты не хотят замедлять прогресс до исторических норм. Они выступают против установки «гигантского ракетного двигателя» на автомобиль, который разгоняет нас с 65 до 10 000 миль в час, особенно если тормоза отключены. Цель — избежать сценария, где сингулярность наступает в 2027 году, сохранив при этом темпы, значительно превышающие текущие.
Метрики риска: Оценки Drake Thomas (Anthropic)
Дрейк Томас из Anthropic, подписавший письмо, приводит конкретные вероятности катастрофических исходов, которые мотивируют его позицию. Он отмечает, что вероятность получения результата, сопоставимого с вымиранием человечества или хуже, оценивается им примерно в 40%. Еще 30% вероятности приходится на сценарий, где будущее содержит некоторые блага, но радикально уступает потенциальному мудрому обществу (менее 5% от максимальной ценности).
| Сценарий будущего | Оценка вероятности (Drake Thomas) | Характеристика |
|---|---|---|
| Катастрофа / Вымирание | ~40% | Исход, сопоставимый с вымиранием человечества или хуже |
| Упущенный потенциал | ~30% | Наличие благ, но результат <5% от возможного максимума |
| Успешный переход | ~30% (остаток) | Реализация потенциала ИИ при сохранении контроля |
Прагматичные требования: Интерпретируемость и аудит
Зви подчеркивает, что «сдерживание» — это не абстрактная философия, а набор конкретных технических и политических мер. Среди приоритетов, озвученных подписантами:
- Интерпретируемость: Глубокое понимание внутренних процессов моделей.
- Аудит: Создание независимой экосистемы для проверки компаний, разрабатывающих ИИ.
- Автоматизация выравнивания: Использование ИИ для улучшения безопасности ИИ (scalable alignment).
- Биобезопасность: Подготовка цивилизации к новым типам угроз.
Почему это важно сейчас
Аргумент «детей, которые не хотят ждать до февраля» (когда подарки уже куплены) иллюстрирует давление рынка и гонку вооружений. Однако подписанты утверждают, что ожидание «идеальных условий» для безопасности перед следующим раундом обучения — это не задержка, а необходимость. Без механизмов контроля ускорение ведет не к прогрессу, а к потере управления. Как отмечает Зви, искренние разногласия в политике ИИ сводятся к разным ожиданиям темпов прогресса и того, что ИИ сможет делать в будущем.
Источник: LessWrong ↗
