Исследования21 августа 2026 г., 19:19 МСК🤖 Auto

Ложные векторы в LLM: как тесты на стабильность обманывают исследователей

Исследование Llama-3.2-3B показало, что извлеченные функциональные векторы могут проходить все стандартные проверки, но выполнять совершенно другую задачу из-за недостаточного разнообразия примеров в few-shot промптах.

Баннер новости 6253

Суть феномена: «Имитаторы» среди векторов

Исследователь star2vec опубликовал работу, демонстрирующую критический недостаток в методах интерпретируемости LLM. При извлечении функциональных векторов (function vectors) для модели Llama-3.2-3B с помощью few-shot примеров, исследователи обнаружили «имитаторов» — векторы, которые:

  • Проходят проверку поведенческого гейта (модель решает задачу в few-shot режиме).
  • Обладают высокой стабильностью (косинусное сходство ≥ 0.99 при извлечении из разных половин данных).
  • Имеют выраженный каузальный эффект (инжекция вектора повышает точность).

Однако, несмотря на эти метрики, векторы заставляли модель игнорировать параметр сдвига k и просто выводить месяц, соседний к запрошенному. Это произошло из-за низкого разнообразия месяцев в обучающих примерах.

Эксперимент и метрики

Исследование проводилось на задачах сдвига месяцев (shift-by-k-months). Векторы извлекались двумя методами: через внимание (Todd) и через скрытые состояния (Hendel). Ключевым фактором стало количество уникальных месяцев в few-shot промпте. Ниже приведены результаты сравнения производительности модели и качества извлеченных векторов в зависимости от разнообразия данных:

Набор месяцев (Diversity) Точность few-shot (Behavioral Gate) Косинусное сходство (Стабильность) Результат после инжекции
Все 12 месяцев Высокая ≥ 0.98 Правильный сдвиг
9 месяцев Рост точности ≥ 0.99 Ошибка: вывод соседнего месяца
4 месяца (январь-апрель) 0.83 (максимум) ≥ 0.99 Ошибка: margin -1.000
Контроль (случайные векторы) Низкая Низкая Нет эффекта

Почему это важно для индустрии

Результаты показывают, что стандартные метрики валидации функциональных векторов (стабильность и каузальный эффект) могут быть обманчивы. При низком разнообразии входных данных модель лучше запоминает паттерн, но вектор кодирует не саму операцию сдвига, а артефакт распределения данных. Инжекция таких «имитаторов» не спасала ситуацию: 0 из 672 настроек инжекции не смогли заставить сломанные векторы работать корректно.

Исследователи предупреждают, что пороги отсечения, калиброванные на случайных данных, могут быть ошибочными в 100–156 раз. Для надежной интерпретируемости необходимо отчетливо указывать разнообразие примеров (example diversity) и проверять не только факт улучшения, но и семантическую корректность выполняемой задачи.

Вывод

Круговая природа концепций (например, месяцев) не гарантирует круговую структуру функциональных векторов, если операция сдвига не симметрична в данных. Исследователям следует быть осторожными с выводом о «функции» вектора, основываясь только на поведенческих тестах без анализа внутренней структуры промпта.

Источник: LessWrong ↗