Суть проблемы: «Сухая щепка»
Стратегия Plan A от AIFP (Alliance for AI Safety) предполагает заморозку прогресса в программном обеспечении (ПО) с ~2030 года при одновременном масштабировании вычислительных мощностей. Автор статьи Том Дэвидсон сравнивает это с остановкой пожара у ворот города, но возведением внутри него зданий из «сухой щепки» (вычислений). Если контроль потерян, пожар распространится мгновенно.
Ключевой риск: если сделка между США и Китаем рухнет, накопленный оверхап вычислений dramatically ускорит software-driven intelligence explosion (взрыв разума, управляемый ПО).
Математика ускорения: от года к дню
Согласно оценкам AIFP, каждый рост вычислений в 10 раз ускоряет взрыв разума в 5 раз. На фоне планируемого роста мощностей, последствия срыва сделки выглядят катастрофически:
| Год срыва сделки | Рост вычислений (относительно старта) | Ускорение взрыва разума | Длительность взрыва (если изначально 1 год) |
|---|---|---|---|
| 2033 | ~100x | 25x быстрее | Несколько недель |
| 2040 | ~10 000x (100x от 2033) | ~600x быстрее | От нескольких дней до 1 дня |
Двойная угроза: Вычисления и ПО
Проблема не только в «железе». Существует второй тип «щепки» — накопленные знания в ПО. Компании могут исследовать алгоритмы, но обязаны публиковать их. Консорциум блокирует опасные реализации. Однако дезертир может мгновенно внедрить все запрещенные техники, получив огромное преимущество.
Это создает два фатальных сценария:
- Нестабильная пауза: Если одна сторона тайно запустит взрыв разума, она получит суперинтеллект за неделю. Страх быть уничтоженным первым провоцирует превентивный удар.
- Более опасный взрыв: Если сделка рушится, гонка вооружений происходит в 600 раз быстрее, чем без Plan A, что делает контроль над ИИ практически невозможным.
Решение AIFP: MACD и его хрупкость
Для предотвращения этого AIFP предлагает Mutually Assured Compute Destruction (MACD) — взаимное гарантированное уничтожение вычислений. Дата-центры США размещаются в Монголии (и требуют «continue-сообщений» от Китая), а китайские — в Канаде. При нарушении сделки одна сторона уничтожает инфраструктуру другой.
Однако автор выделяет три критических провала MACD:
- Задержка обнаружения: Если на выявление нарушения уходят дни, дезертир успеет вывезти веса моделей и алгоритмы до уничтожения дата-центров.
- Физическая защита: Задержки в уничтожении позволяют стороне-нарушителю использовать ИИ-роботов для защиты инфраструктуры или отключения чипов.
- Политическая воля: Логика MACD противоположна ядерному сдерживанию. Уничтожение вычислений наносит немедленный экономический ущерб. Страна-жертва может предпочесть не уничтожать свои центры, а попытаться выиграть гонку, так как MACD не гарантирует победы, а лишь обнуляет ресурсы.
Вывод: Риск создания угрозы
Если вероятность катастрофы от ИИ мала, Plan A может быть приемлем. Но если базовый сценарий предполагает, что взрыв разума маловероятен из-за нехватки вычислений, то Plan A создает эту угрозу искусственно. Накопление мощностей и знаний превращает потенциально управляемый процесс в гонку, где победа определяется скоростью, а не безопасностью, делая риск захвата власти ИИ (AI takeover) критическим.
Источник: LessWrong ↗
