Четыре ключевых задачи механистической интерпретируемости
Команда ValueShift Research, изучающая природу отказа (refusal) в больших языковых моделях, предложила системный подход к исследованию представлений концепций. Выделены четыре обязательных этапа работы с векторными представлениями:
- Job 1: Поиск представления концепции. Нахождение вектора или геометрической фигуры, определяющей интересующий нас концепт (например, отказ). На этом этапе устанавливается корреляция: изменение входа меняет активации, но причинно-следственная связь еще не доказана.
- Job 2: Установление причинной роли. Доказательство того, что найденное представление действительно влияет на поведение модели определенным образом.
- Job 3: Установление необходимости. Определение, является ли найденное представление единственным фактором, ключевым или лишь одним из многих.
- Job 4: Управление (Steering). Влияние на представление для изменения поведения модели в сторону большей надежности и безопасности.
Анализ методов поиска концепций (Job 1)
В первой части исследования авторы сосредоточились на методах поиска. Они проанализировали четыре основных подхода, каждый из которых имеет свои преимущества и ограничения. Ниже приведено сравнение выбранных методов:
| Метод | Суть | Плюсы | Минусы и критика |
|---|---|---|---|
| Линейные зонды (Linear Probes) | Использование линейного классификатора для предсказания концепта по активациям слоев. | Низкая вычислительная стоимость; простота внедрения. | Показывают наличие информации, но не её использование для ответа; требуют заранее заданной концепции; низкая точность для сложных, «запутанных» концептов. |
| Разность средних (Difference-in-means) | Сравнение средних значений активаций при наличии и отсутствии концепта. | Простота вычислений. | Схожие с линейными зондами проблемы: отсутствие механизма выделения причинно-следственных связей; критика за недостаточную точность. |
| Разреженные автоэнкодеры (SAEs) | Декомпозиция активаций на разреженные компоненты. | Позволяют анализировать причинность; набирают популярность в сообществе. | Требуют осторожности в интерпретации; существуют критические замечания относительно их надежности без дополнительной валидации. |
| PCA и кластеризация | Выделение значимых компонент из активаций без предварительного задания концепта. | Позволяют обнаруживать неизвестные ранее паттерны (data-driven подход). | Требуют последующего ручного определения найденных компонент исследователем. |
Почему это важно для AI Safety
Исследование фокусируется на концепции «отказа» (refusal) — способности модели отказываться от выполнения вредоносных запросов. Понимание того, как именно эта концепция закодирована в нейронной сети, критически важно для создания безопасных систем в критических доменах: медицине, кибербезопасности и других областях, где ошибка модели может стоить жизни или привести к катастрофическим последствиям.
Авторы отмечают, что линейные зонды, будучи популярными из-за дешевизны, часто оказываются недостаточно точными для извлечения сложных, переплетенных концептов, таких как отказ. Это подчеркивает необходимость перехода к более сложным методам, таким как SAE, и строгой статистической проверки результатов.
Дальнейшие шаги
В следующих публикациях команда ValueShift Research планирует детально разобрать методы для Job 2 (причинность), Job 3 (необходимость) и Job 4 (управление), предлагая сообществу обсудить и дополнить предложенную таксономию.
Источник: LessWrong ↗
