Исследования18 сентября 2026 г., 08:18 МСК🤖 Auto

RoSA: Почему экстраполяция не спасет от суперинтеллекта

Автор Arihant Gadgade предлагает фреймворк RoSA, доказывая, что для надежной совместимости с ИИ нужны не эмпирические тесты, а инвариантные доказательства, выведенные от целей суперинтеллекта.

Баннер новости 7770

Исследователь Arihant Gadgade опубликовал статью в LessWrong, где систематизирует подходы к безопасности ИИ (alignment) через новую матрицу. Ключевой тезис: текущие методы, основанные на эмпирике и экстраполяции от современных моделей, принципиально недостаточны для гарантии безопасности суперинтеллекта. Автор вводит концепцию RoSA (Robust Superintelligence Alignment) — надежной совместимости, требующей формальных инвариантов.

Двухосевая классификация исследований

Вся работа в области alignment разбивается на четыре квадранта в зависимости от направления рассуждения и типа обоснования безопасности:

  • Направление (Axis 1): Forward Chaining (от текущих моделей к будущему) vs. Backchaining (от целей суперинтеллекта к текущим методам).
  • Обоснование (Axis 2): Extrapolation (эмпирическая экстраполяция) vs. Invariant (формальное структурное доказательство неизменности свойства).

Автор утверждает, что только пересечение Backchaining и Invariant дает надежный результат. Остальные подходы содержат критические уязвимости.

Почему экстраполяция опасна

Аргумент «Persistence» (Персистентность): успех метода на уровне сильного, но не сверхчеловеческого ИИ не гарантирует его работу на уровне суперинтеллекта. Суперинтеллект будет действовать в режимах, недоступных для эмпирического тестирования. Новые режимы пороют новые, неизвестные виды отказов. Эмпирический успех не является формальным доказательством.

Почему Forward Chaining неполно

Аргумент «Completeness» (Полнота): движение от текущих моделей (Forward Chaining) позволяет найти локальные инварианты, но не гарантирует, что мы устранили все возможные точки отказа суперинтеллекта. Мы можем «не заметить» уязвимости, которые проявятся только при радикальном росте вычислительных мощностей. Полнота набора необходимых свойств безопасности может быть установлена только через Backchaining — анализ того, что именно нужно суперинтеллекту, чтобы не навредить.

Матрица подходов к Alignment

Ниже представлена классификация методов согласно статье:

НаправлениеExtrapolation (Эмпирика)Invariant (Формальное доказательство)
Forward Chaining
(От текущего ИИ)
RLHF/RLAIF, red teaming, эмпирический контроль, прагматичный механистический интерпретационный анализАмбициозный механистический интерпретационный анализ (Ambitious mech interp)
Backchaining
(От целей суперинтеллекта)
Эмпирические тесты дебатов, IDA, weak-to-strong generalizationRoSA
Agent foundations, теория обучения для alignment, теоретический анализ дебатов

Роль Forward Chaining

Gadgade не отрицает ценность текущих методов. Forward Chaining необходим для:

  • Снижения рисков от текущих и близких моделей.
  • Создания тестовых стендов для теоретических идей.
  • Разработки автоматизированных систем alignment, которые в будущем смогут обеспечить инвариантные гарантии.

Однако, чтобы установить (establish) RoSA, а не просто приблизиться к ней, требуется переход к инвариантным доказательствам, выведенным от целей суперинтеллекта.

Источник: LessWrong ↗