Проблема: Артефакт или реальность?
Основная проблема безопасности ИИ заключается в том, что модели, обученные в одной среде, могут вести себя непредсказуемо в другой. Часто это связано с тем, что внутренние абстракции (упрощения мира, которые строит нейросеть) являются не отражением объективной реальности, а следствием конкретного выбора архитектуры или данных. Если абстракция «ненаaturalна», она может разрушиться при изменении способа представления информации, что приведет к срыву выравнивания (alignment).
Дженни Бенедикт, автор исследования в рамках Fellowship 2026 от Dovetail Research, предлагает тест на «естественность» (naturality). Идея проста: если абстракция действительно отражает структуру мира, она должна сохраняться при переводе модели из одной вычислительной системы в другую. Если же она исчезает — это артефакт представления.
Методология: Перевод между моделями вычислений
Вместо статистического подхода, авторы гипотезы о естественных абстракциях (NAH) обычно используют, Бенедикт перешла к детерминированной среде теории вычислимости. Она рассматривает модели вычислений как прокси-миры, конгруэнции — как абстракции, а карты перевода (translation maps) — как изменение представления.
Ключевое требование к переводу: он должен сохранять корректность программ. То есть, если программа $P$ в модели $M_1$ дает результат $R$ при тесте $T$, то переведенная программа $f(P)$ в модели $M_2$ должна давать эквивалентный результат при соответствующем тесте.
Ключевые результаты
Исследование вывело два строгих математических вывода о том, какие абстракции могут считаться устойчивыми:
| Результат | Условие | Значение для ИИ |
|---|---|---|
| Результат 1 | Абстракция сохраняется при любом изменении представления. | Такая абстракция слишком груба. Это поведенческая эквивалентность. Она не дает информации о внутренней структуре модели, поэтому бесполезна для анализа причин поведения. |
| Результат 2 | Абстракция тоньше поведенческой эквивалентности, но все же сохраняется. | Возможно только при трех условиях: 1) абстракция композиционна; 2) в целевой модели нельзя собрать большую программу из маленьких так, чтобы они «склеились»; 3) нет принудительного слияния ранее раздельных программ. |
Почему это важно для безопасности ИИ
Результат 2 является наиболее значимым. Он показывает, что «естественные» абстракции — это не просто совпадения, а структурные свойства, которые выживают при репрезентационных сдвигах. Это позволяет разработчикам:
- Отличать истинные знания модели о мире от случайных корреляций в данных.
- Оценивать устойчивость внутренних представлений (world models) к изменениям архитектуры или формата ввода.
- Создавать более надежные системы интерпретируемости, проверяя, какие именно паттерны в активациях нейронов являются инвариантными.
Технические детали и инструменты
Для формализации доказательств использовалась помощь ИИ-ассистентов (Claude Fable 5.0 и Opus 4.8), однако идеи и верификация остались за человеком. Исследование опирается на классические модели: машины Тьюринга, λ-исчисление, клеточные автоматы и JavaScript, демонстрируя, что теоретические выводы применимы к широкому спектру вычислительных субстратов.
Работа финансируется Агентством перспективных исследований и изобретений (ARIA) в рамках проекта MSAI-SE01-P005.
Источник: LessWrong ↗
