Исследования18 августа 2026 г., 02:19 МСК🤖 Auto

AI-портал AIKraft: Проверка внутренних карт действий в LLM

Исследователи из arXiv представили новый метод тестирования интерпретируемости нейросетей, доказав, что скрытые состояния могут быть декодируемыми, но не поддерживающими глобальную аффинную замыкаемость.

Баннер новости 5959

Суть исследования: Разделение декодируемости и функциональности

Новая работа, опубликованная в arXiv (cs.AI), ставит под сомнение упрощенное представление о том, что если скрытое состояние нейросети можно декодировать, оно обязательно участвует в логике принятия решений. Авторы вводят концепцию Internal Action Maps (внутренних карт действий) и проводят калиброванный тест, чтобы определить, способны ли эти карты достигать естественной пост-активации и композиционно взаимодействовать без наличия исходных данных.

Методология: Решетка доказательств и группа S_5

Тестирование организовано в виде evidence lattice (решетки доказательств). Для валидации геометрической ветви тестов используется известный аффинный носитель группы симметрии S_5 (симметрии пяти элементов). Это позволяет строго математически проверить, проходят ли модели ряд критических «ворот» (gates):

  • Одношаговое действие (one-step)
  • Композиция (composition)
  • Обратимость (inverse)
  • Декодирование (decoding)
  • Коммутативность (commutativity)

Ключевые метрики и результаты

Исследование выявило интересную закономерность: структурированная кривизна и сопряженность в удерживаемой области монотонно повышают ошибку. Однако, несмотря на это, большинство сильнейших ячеек (cells) успешно справляются с проверкой замыкаемости. Из 30 сильнейших ячеек только 23 не прошли проверку на замыкаемость (flip a closure gate), что позволяет ограничить, а не полностью исключить наличие функциональных карт действий.

Критерий проверки Описание теста Результат в контексте S_5
One-step Проверка одношагового перехода состояния Все held-source folds прошли
Composition Способность к композиционному взаимодействию Успешно для базовых структур
Inverse Наличие обратного действия Подтверждено для валидных ветвей
Closure Gate Проверка глобального аффинного замыкания 23/30 сильнейших ячеек «перевернули» ворота (не прошли)

Почему это важно для индустрии

Результаты показывают, что интерпретируемость нейросетей — это не бинарное свойство. Скрытые сигналы могут быть полезны для декодирования информации, но при этом не формировать устойчивых, переиспользуемых карт действий. Это критически важно для разработчиков систем безопасности и объяснимого ИИ (XAI), так как указывает на необходимость более тонких методов анализа, чем просто поиск паттернов в скрытых слоях.

Источник: arXiv cs.AI ↗