Кризис интерпретируемости: что мы на самом деле читаем?
Недавний интерес к методам вроде J-Lens от Anthropic вновь поднял фундаментальный вопрос: что именно означает внутренний вектор нейросети? Существующие подходы — Logit Lens, Tuned Lens, Patchscopes и Jacobian Lens — являются эвристическими. Они не имеют принципаального ответа на вопрос о «ground truth» (истинном значении) скрытого состояния, так как их результаты зависят от внешних факторов: обучающих наборов данных, сторонних моделей или конкретных промптов.
Сравнение существующих методов декодирования
Каждый из текущих методов имеет свои ограничения, которые сводятся к зависимости от внешних данных. Ниже приведено сравнение ключевых характеристик:
| Метод | Принцип работы | Недостатки / Зависимости |
|---|---|---|
| Logit Lens | Прямое проецирование вектора в пространство логитов | Неточность: вектор «дрейфует» между слоями, не попадая в финальное пространство представлений |
| Tuned Lens | Обучение аффинного отображения для каждого слоя | Требует больших объемов данных (напр., Pile validation set) для обучения маппинга |
| Patchscopes | Подача вектора во внешнюю модель с промптом | Результат критически зависит от выбранной модели, формулировки промпта и метода патчинга |
| Jacobian Lens | Использование усредненной матрицы Якоби | Требует «подгонки» на корпусе промптов (100–1000 штук). Пример: 51 мин на GPU для 100 промптов |
Новый подход: Геометрическая линза (Geometric Lens)
Автор статьи утверждает, что истинное значение скрытого вектора должно определяться внутренней геометрией самой модели, а не внешними данными. В сетях с кусочно-линейными функциями активации (например, ReLU) пространство ввода разбивается на множество плоских линейных «кусков» (regions). Истинное значение вектора определяется тем, в какой именно «кусок» он попадает, а не тем, как его трансформирует внешняя функция.
Механизм: Деревья линейных регионов
Архитектура LLM создает древовидную структуру регионов. Каждый выходной токен (например, «_a») коренится в финальном слое и ветвится на все более мелкие линейные регионы по мере продвижения к эмбеддингу. Если входной токен «is» попадает в регион, соответствующий дереву токена «_a», модель предсказывает «_a».
Ключевой момент: кросс-токенное внимание (attention к другим токенам в последовательности) вызывает «межрегиональный транспорт». Оно может вытолкнуть скрытый вектор из его текущего статического региона в другой, что объясняет, как контекст меняет внутреннее представление токена. Этот подход предлагает детерминированный способ интерпретации, основанный на структуре самой нейросети.
Источник: LessWrong ↗
