Исследования31 августа 2026 г., 10:17 МСК🤖 Auto

CTA: Как линейные зонды учатся видеть концепции внутри LLM

Исследователи представили CTA — метод, который объясняет не то, какой токен сгенерирует модель, а почему в её скрытых слоях возникает конкретная концепция. Это прорыв в механистической интерпретируемости.

Баннер новости 6400

От токенов к внутренним концепциям

Традиционные методы атрибуции (например, Integrated Gradients) обычно отвечают на вопрос: «Почему модель выбрала следующий токен?». Однако для аудита безопасности и понимания логики LLM важнее другой вопрос: «Почему в скрытом представлении появилась конкретная концепция (например, «опасность» или «ложь»), даже если она не была выражена в ответе?»

Команда исследователей из ETH Zurich и других институтов (Vedant Palit, Zhijing Jin и др.) предложила Concept-Targeted Attribution (CTA). Этот метод обучает графы атрибуции транскодеров не на логитах (вероятностях токенов), а на направлениях линейных зондов (linear probes). Это позволяет изолировать «цепочки» вычислений, ответственные за появление внутреннего представления концепции, независимо от итогового вывода модели.

Механистическая связь: от точности к структуре

Ключевое достижение CTA — установление прямой количественной связи между производительностью зонда и структурой нейронных цепей. Авторы использовали Cross-Layer Transcoders для анализа четырех широких категорий концепций. Результаты показали высокую предсказуемость:

Метрика Значение Что это означает
Корреляция Пирсона ($\rho$) 0.91 Сильная линейная связь между признаками графа и точностью зонда
Коэффициент детерминации ($R^2$) 0.84 84% вариации точности зонда объясняется структурой графа атрибуции

Локальные признаки графа позволяют точно идентифицировать разреженные компоненты (sparse components), которые принимают решение по каждому конкретному запросу. Это переводит аудит из плоскости «зонд работает/не работает» в плоскость «какие именно нейроны и связи обеспечивают эту работу».

Каузальные аблиации: доказательство различий

Чтобы доказать, что CTA выявляет принципиально иные механизмы, чем стандартные методы, авторы провели каузальные аблиации (удаление важных элементов графа). Результаты четко разделили два типа вычислений:

  • Удаление признаков, важных для зонда (CTA): Снижает внутренние оценки концепции, но почти не меняет сгенерированный токен. Модель «думает» об опасности, но не реагирует на неё в тексте.
  • Удаление признаков, важных для логитов: Изменяет сгенерированный токен в 92–100% случаев, при этом баллы зонда остаются почти неизменными. Это классический поведенческий эффект.

Значение для безопасности и интерпретируемости

Статья принята в EMNLP 2026 (Main Conference). Предложенный фреймворк позволяет проводить детальный аудит внутренних представлений, включая критически важные для безопасности аспекты. Теперь исследователи могут отслеживать, как именно формируется скрытое понимание модели, не полагаясь только на её внешнее поведение. Код решения доступен на GitHub.

Источник: arXiv cs.CL ↗