Исследования7 октября 2026 г., 22:20 МСК🤖 Auto

eNTK: Новый метод интерпретируемости, раскрывающий «мышление» LLM

Исследовательница Дженнифер Лин представила метод Empirical Neural Tangent Kernel (eNTK), позволяющий находить интерпретируемые признаки в нейросетях через анализ градиентов, а не активаций.

Баннер новости 9144

Метод интерпретируемости нейронных сетей (Mechanistic Interpretability) получил новый мощный инструмент. В отличие от стандартных подходов, таких как Sparse Autoencoders (SAE), которые кластеризуют активации, новый метод Empirical Neural Tangent Kernel (eNTK) анализирует то, как модель обучается. Он выявляет признаки, основываясь на градиентах весов: какие изменения параметров повышают вероятность конкретного токена при данном входе.

Как работает eNTK: от градиентов к признакам

Суть метода заключается в вычислении матрицы, где каждая строка — это градиент логита выходного токена по весам модели для конкретного входного контекста. Это позволяет понять, какие поведения в модели «когерентны» (поддерживают друг друга), а какие конфликтуют. Ключевым шагом является поиск собственных векторов (eigenvectors) этой матрицы:

  • Собственные векторы представляют собой паттерны данных, на которых обучение модели усиливает определенные выходы.
  • Собственные значения показывают, насколько сильно модель обобщает эти паттерны. Топовые собственные значения соответствуют признакам, которые модель использует для генерализации знаний.

Таким образом, eNTK переводит абстрактные градиенты в понятные векторы в пространстве весов и активаций, раскрывая «интерпретируемые признаки» без необходимости размеченных данных.

Результаты тестирования: Грамматика и математика

Эффективность метода была проверена на трех типах моделей: однослойном MLP, однослойном Трансформере и LLM Gemma-3-270M. Результаты демонстрируют высокую точность восстановления известных признаков в синтетических задачах и выдающиеся результаты в языковых моделях.

Модель / Задача Что выявил eNTK Сравнение с альтернативами
1-layer MLP & Transformer (modular addition) Точное восстановление подпространства известных математических признаков Полное совпадение с ground-truth
Gemma-3-270M (TinyStories) Грамматические категории: существительные, глаголы, наречия, прошедшее время Превосходит PCA по активациям при том же бюджете вычислений
Toy-модели суперпозиции Восстановление истинных признаков в условиях суперпозиции Подтверждено в ранних версиях исследования

Почему это важно для AI-индустрии

Метод eNTK предлагает новый взгляд на то, как нейросети организуют знания. Если SAE ищут признаки в «статике» (активациях), то eNTK смотрит в «динамику» обучения. Это позволяет обнаруживать признаки, которые модель использует для обобщения, даже если они не ярко выражены в текущих активациях. Для исследователей интерпретируемости это открывает путь к более глубокому пониманию того, как LLM формируют синтаксические и семантические структуры, не прибегая к дорогостоящим методам обучения с подкреплением или разметке данных.

Источник: LessWrong ↗