Исследования16 сентября 2026 г., 20:18 МСК🤖 Auto

LessWrong: Систематизация механистической интерпретируемости для безопасности AI

Исследователи из ValueShift Research представили таксономию методов поиска концепций в LLM, разделив задачи на 4 этапа и проанализировав эффективность линейных зондов, SAE и PCA.

Баннер новости 7650

Четыре ключевых задачи механистической интерпретируемости

Команда ValueShift Research, изучающая природу отказа (refusal) в больших языковых моделях, предложила системный подход к исследованию представлений концепций. Выделены четыре обязательных этапа работы с векторными представлениями:

  • Job 1: Поиск представления концепции. Нахождение вектора или геометрической фигуры, определяющей интересующий нас концепт (например, отказ). На этом этапе устанавливается корреляция: изменение входа меняет активации, но причинно-следственная связь еще не доказана.
  • Job 2: Установление причинной роли. Доказательство того, что найденное представление действительно влияет на поведение модели определенным образом.
  • Job 3: Установление необходимости. Определение, является ли найденное представление единственным фактором, ключевым или лишь одним из многих.
  • Job 4: Управление (Steering). Влияние на представление для изменения поведения модели в сторону большей надежности и безопасности.

Анализ методов поиска концепций (Job 1)

В первой части исследования авторы сосредоточились на методах поиска. Они проанализировали четыре основных подхода, каждый из которых имеет свои преимущества и ограничения. Ниже приведено сравнение выбранных методов:

Метод Суть Плюсы Минусы и критика
Линейные зонды (Linear Probes) Использование линейного классификатора для предсказания концепта по активациям слоев. Низкая вычислительная стоимость; простота внедрения. Показывают наличие информации, но не её использование для ответа; требуют заранее заданной концепции; низкая точность для сложных, «запутанных» концептов.
Разность средних (Difference-in-means) Сравнение средних значений активаций при наличии и отсутствии концепта. Простота вычислений. Схожие с линейными зондами проблемы: отсутствие механизма выделения причинно-следственных связей; критика за недостаточную точность.
Разреженные автоэнкодеры (SAEs) Декомпозиция активаций на разреженные компоненты. Позволяют анализировать причинность; набирают популярность в сообществе. Требуют осторожности в интерпретации; существуют критические замечания относительно их надежности без дополнительной валидации.
PCA и кластеризация Выделение значимых компонент из активаций без предварительного задания концепта. Позволяют обнаруживать неизвестные ранее паттерны (data-driven подход). Требуют последующего ручного определения найденных компонент исследователем.

Почему это важно для AI Safety

Исследование фокусируется на концепции «отказа» (refusal) — способности модели отказываться от выполнения вредоносных запросов. Понимание того, как именно эта концепция закодирована в нейронной сети, критически важно для создания безопасных систем в критических доменах: медицине, кибербезопасности и других областях, где ошибка модели может стоить жизни или привести к катастрофическим последствиям.

Авторы отмечают, что линейные зонды, будучи популярными из-за дешевизны, часто оказываются недостаточно точными для извлечения сложных, переплетенных концептов, таких как отказ. Это подчеркивает необходимость перехода к более сложным методам, таким как SAE, и строгой статистической проверки результатов.

Дальнейшие шаги

В следующих публикациях команда ValueShift Research планирует детально разобрать методы для Job 2 (причинность), Job 3 (необходимость) и Job 4 (управление), предлагая сообществу обсудить и дополнить предложенную таксономию.

Источник: LessWrong ↗