Исследователь Arihant Gadgade опубликовал статью в LessWrong, где систематизирует подходы к безопасности ИИ (alignment) через новую матрицу. Ключевой тезис: текущие методы, основанные на эмпирике и экстраполяции от современных моделей, принципиально недостаточны для гарантии безопасности суперинтеллекта. Автор вводит концепцию RoSA (Robust Superintelligence Alignment) — надежной совместимости, требующей формальных инвариантов.
Двухосевая классификация исследований
Вся работа в области alignment разбивается на четыре квадранта в зависимости от направления рассуждения и типа обоснования безопасности:
- Направление (Axis 1): Forward Chaining (от текущих моделей к будущему) vs. Backchaining (от целей суперинтеллекта к текущим методам).
- Обоснование (Axis 2): Extrapolation (эмпирическая экстраполяция) vs. Invariant (формальное структурное доказательство неизменности свойства).
Автор утверждает, что только пересечение Backchaining и Invariant дает надежный результат. Остальные подходы содержат критические уязвимости.
Почему экстраполяция опасна
Аргумент «Persistence» (Персистентность): успех метода на уровне сильного, но не сверхчеловеческого ИИ не гарантирует его работу на уровне суперинтеллекта. Суперинтеллект будет действовать в режимах, недоступных для эмпирического тестирования. Новые режимы пороют новые, неизвестные виды отказов. Эмпирический успех не является формальным доказательством.
Почему Forward Chaining неполно
Аргумент «Completeness» (Полнота): движение от текущих моделей (Forward Chaining) позволяет найти локальные инварианты, но не гарантирует, что мы устранили все возможные точки отказа суперинтеллекта. Мы можем «не заметить» уязвимости, которые проявятся только при радикальном росте вычислительных мощностей. Полнота набора необходимых свойств безопасности может быть установлена только через Backchaining — анализ того, что именно нужно суперинтеллекту, чтобы не навредить.
Матрица подходов к Alignment
Ниже представлена классификация методов согласно статье:
| Направление | Extrapolation (Эмпирика) | Invariant (Формальное доказательство) |
|---|---|---|
| Forward Chaining (От текущего ИИ) | RLHF/RLAIF, red teaming, эмпирический контроль, прагматичный механистический интерпретационный анализ | Амбициозный механистический интерпретационный анализ (Ambitious mech interp) |
| Backchaining (От целей суперинтеллекта) | Эмпирические тесты дебатов, IDA, weak-to-strong generalization | RoSA Agent foundations, теория обучения для alignment, теоретический анализ дебатов |
Роль Forward Chaining
Gadgade не отрицает ценность текущих методов. Forward Chaining необходим для:
- Снижения рисков от текущих и близких моделей.
- Создания тестовых стендов для теоретических идей.
- Разработки автоматизированных систем alignment, которые в будущем смогут обеспечить инвариантные гарантии.
Однако, чтобы установить (establish) RoSA, а не просто приблизиться к ней, требуется переход к инвариантным доказательствам, выведенным от целей суперинтеллекта.
Источник: LessWrong ↗
