Исследования20 июля 2026 г., 06:17 МСК🤖 Auto

Геометрическая линза: как найти истину в скрытых слоях LLM

Исследователь Chunwei Ma предлагает отказаться от внешних метрик и интерпретировать внутренние представления LLM через их собственную кусочно-линейную геометрию, решая проблему отсутствия «истины» (ground truth).

Баннер новости 3917

Кризис интерпретируемости: что мы на самом деле читаем?

Недавний интерес к методам вроде J-Lens от Anthropic вновь поднял фундаментальный вопрос: что именно означает внутренний вектор нейросети? Существующие подходы — Logit Lens, Tuned Lens, Patchscopes и Jacobian Lens — являются эвристическими. Они не имеют принципаального ответа на вопрос о «ground truth» (истинном значении) скрытого состояния, так как их результаты зависят от внешних факторов: обучающих наборов данных, сторонних моделей или конкретных промптов.

Сравнение существующих методов декодирования

Каждый из текущих методов имеет свои ограничения, которые сводятся к зависимости от внешних данных. Ниже приведено сравнение ключевых характеристик:

Метод Принцип работы Недостатки / Зависимости
Logit Lens Прямое проецирование вектора в пространство логитов Неточность: вектор «дрейфует» между слоями, не попадая в финальное пространство представлений
Tuned Lens Обучение аффинного отображения для каждого слоя Требует больших объемов данных (напр., Pile validation set) для обучения маппинга
Patchscopes Подача вектора во внешнюю модель с промптом Результат критически зависит от выбранной модели, формулировки промпта и метода патчинга
Jacobian Lens Использование усредненной матрицы Якоби Требует «подгонки» на корпусе промптов (100–1000 штук). Пример: 51 мин на GPU для 100 промптов

Новый подход: Геометрическая линза (Geometric Lens)

Автор статьи утверждает, что истинное значение скрытого вектора должно определяться внутренней геометрией самой модели, а не внешними данными. В сетях с кусочно-линейными функциями активации (например, ReLU) пространство ввода разбивается на множество плоских линейных «кусков» (regions). Истинное значение вектора определяется тем, в какой именно «кусок» он попадает, а не тем, как его трансформирует внешняя функция.

Механизм: Деревья линейных регионов

Архитектура LLM создает древовидную структуру регионов. Каждый выходной токен (например, «_a») коренится в финальном слое и ветвится на все более мелкие линейные регионы по мере продвижения к эмбеддингу. Если входной токен «is» попадает в регион, соответствующий дереву токена «_a», модель предсказывает «_a».

Ключевой момент: кросс-токенное внимание (attention к другим токенам в последовательности) вызывает «межрегиональный транспорт». Оно может вытолкнуть скрытый вектор из его текущего статического региона в другой, что объясняет, как контекст меняет внутреннее представление токена. Этот подход предлагает детерминированный способ интерпретации, основанный на структуре самой нейросети.

Источник: LessWrong ↗