Исследования11 сентября 2026 г., 04:17 МСК🤖 Auto

Тест на «естественность» абстракций: как проверить миромодели ИИ

Исследовательница Дженни Бенедикт предложила формальный метод проверки, являются ли внутренние представления ИИ отражением реальности или артефактом архитектуры, используя теорию вычислимости.

Баннер новости 7230

Проблема: Артефакт или реальность?

Основная проблема безопасности ИИ заключается в том, что модели, обученные в одной среде, могут вести себя непредсказуемо в другой. Часто это связано с тем, что внутренние абстракции (упрощения мира, которые строит нейросеть) являются не отражением объективной реальности, а следствием конкретного выбора архитектуры или данных. Если абстракция «ненаaturalна», она может разрушиться при изменении способа представления информации, что приведет к срыву выравнивания (alignment).

Дженни Бенедикт, автор исследования в рамках Fellowship 2026 от Dovetail Research, предлагает тест на «естественность» (naturality). Идея проста: если абстракция действительно отражает структуру мира, она должна сохраняться при переводе модели из одной вычислительной системы в другую. Если же она исчезает — это артефакт представления.

Методология: Перевод между моделями вычислений

Вместо статистического подхода, авторы гипотезы о естественных абстракциях (NAH) обычно используют, Бенедикт перешла к детерминированной среде теории вычислимости. Она рассматривает модели вычислений как прокси-миры, конгруэнции — как абстракции, а карты перевода (translation maps) — как изменение представления.

Ключевое требование к переводу: он должен сохранять корректность программ. То есть, если программа $P$ в модели $M_1$ дает результат $R$ при тесте $T$, то переведенная программа $f(P)$ в модели $M_2$ должна давать эквивалентный результат при соответствующем тесте.

Ключевые результаты

Исследование вывело два строгих математических вывода о том, какие абстракции могут считаться устойчивыми:

Результат Условие Значение для ИИ
Результат 1 Абстракция сохраняется при любом изменении представления. Такая абстракция слишком груба. Это поведенческая эквивалентность. Она не дает информации о внутренней структуре модели, поэтому бесполезна для анализа причин поведения.
Результат 2 Абстракция тоньше поведенческой эквивалентности, но все же сохраняется. Возможно только при трех условиях: 1) абстракция композиционна; 2) в целевой модели нельзя собрать большую программу из маленьких так, чтобы они «склеились»; 3) нет принудительного слияния ранее раздельных программ.

Почему это важно для безопасности ИИ

Результат 2 является наиболее значимым. Он показывает, что «естественные» абстракции — это не просто совпадения, а структурные свойства, которые выживают при репрезентационных сдвигах. Это позволяет разработчикам:

  • Отличать истинные знания модели о мире от случайных корреляций в данных.
  • Оценивать устойчивость внутренних представлений (world models) к изменениям архитектуры или формата ввода.
  • Создавать более надежные системы интерпретируемости, проверяя, какие именно паттерны в активациях нейронов являются инвариантными.

Технические детали и инструменты

Для формализации доказательств использовалась помощь ИИ-ассистентов (Claude Fable 5.0 и Opus 4.8), однако идеи и верификация остались за человеком. Исследование опирается на классические модели: машины Тьюринга, λ-исчисление, клеточные автоматы и JavaScript, демонстрируя, что теоретические выводы применимы к широкому спектру вычислительных субстратов.

Работа финансируется Агентством перспективных исследований и изобретений (ARIA) в рамках проекта MSAI-SE01-P005.

Источник: LessWrong ↗