Суть феномена: «Имитаторы» среди векторов
Исследователь star2vec опубликовал работу, демонстрирующую критический недостаток в методах интерпретируемости LLM. При извлечении функциональных векторов (function vectors) для модели Llama-3.2-3B с помощью few-shot примеров, исследователи обнаружили «имитаторов» — векторы, которые:
- Проходят проверку поведенческого гейта (модель решает задачу в few-shot режиме).
- Обладают высокой стабильностью (косинусное сходство ≥ 0.99 при извлечении из разных половин данных).
- Имеют выраженный каузальный эффект (инжекция вектора повышает точность).
Однако, несмотря на эти метрики, векторы заставляли модель игнорировать параметр сдвига k и просто выводить месяц, соседний к запрошенному. Это произошло из-за низкого разнообразия месяцев в обучающих примерах.
Эксперимент и метрики
Исследование проводилось на задачах сдвига месяцев (shift-by-k-months). Векторы извлекались двумя методами: через внимание (Todd) и через скрытые состояния (Hendel). Ключевым фактором стало количество уникальных месяцев в few-shot промпте. Ниже приведены результаты сравнения производительности модели и качества извлеченных векторов в зависимости от разнообразия данных:
| Набор месяцев (Diversity) | Точность few-shot (Behavioral Gate) | Косинусное сходство (Стабильность) | Результат после инжекции |
|---|---|---|---|
| Все 12 месяцев | Высокая | ≥ 0.98 | Правильный сдвиг |
| 9 месяцев | Рост точности | ≥ 0.99 | Ошибка: вывод соседнего месяца |
| 4 месяца (январь-апрель) | 0.83 (максимум) | ≥ 0.99 | Ошибка: margin -1.000 |
| Контроль (случайные векторы) | Низкая | Низкая | Нет эффекта |
Почему это важно для индустрии
Результаты показывают, что стандартные метрики валидации функциональных векторов (стабильность и каузальный эффект) могут быть обманчивы. При низком разнообразии входных данных модель лучше запоминает паттерн, но вектор кодирует не саму операцию сдвига, а артефакт распределения данных. Инжекция таких «имитаторов» не спасала ситуацию: 0 из 672 настроек инжекции не смогли заставить сломанные векторы работать корректно.
Исследователи предупреждают, что пороги отсечения, калиброванные на случайных данных, могут быть ошибочными в 100–156 раз. Для надежной интерпретируемости необходимо отчетливо указывать разнообразие примеров (example diversity) и проверять не только факт улучшения, но и семантическую корректность выполняемой задачи.
Вывод
Круговая природа концепций (например, месяцев) не гарантирует круговую структуру функциональных векторов, если операция сдвига не симметрична в данных. Исследователям следует быть осторожными с выводом о «функции» вектора, основываясь только на поведенческих тестах без анализа внутренней структуры промпта.
Источник: LessWrong ↗
