Исследования8 августа 2026 г., 02:18 МСК🤖 Auto

PoolBench: почему последний токен — плохой выбор для интерпретации LLM

Исследование Ayushi Agarwal доказывает: стандартный метод извлечения признаков (last token) статистически хуже продвинутых стратегий пулинга, но даже лучшие методы не гарантируют управляемость моделей.

Баннер новости 5346

Проблема: хаос в оценке концептов

В работе с decoder-only LLM (таких как Llama, Gemma, Mistral) критическим, но часто игнорируемым шагом является пулинг — сжатие токенов в единый вектор представления концепта. До сих пор исследователи сравнивали результаты, меняя одновременно датасеты, слои нейросетей и методы пулинга, что делало выводы ненадежными. PoolBench — это первый бенчмарк, изолирующий пулинг как единственную переменную.

Методология: строгий контроль

Авторы создали единый аудированный корпус из 37 693 реальных текстовых отрывков. Тестирование проводилось на трех открытых моделях: Llama-3.1-8B, Gemma-2-9B и Mistral-7B. Были протестированы 19 стратегий пулинга для 17 концептов. Основной метрикой стала линейная разделимость (D1/AUROC), дополнительные — управляемость (D2/SCP) и дезаплетирование вывода (D3).

Результаты: W4_hierarchical побеждает

Стратегия W4_hierarchical показала наилучшие результаты, достигнув среднего AUROC 0.7799. Классический подход P1_last_token (взятие состояния последнего токена) оказался статистически значимо хуже (p = 2.0e-36), набрав лишь 0.7640. На задачах средней сложности разрыв достигал 0.042–0.113 AUROC.

Стратегия Средний AUROC (D1) Статус
W4_hierarchical 0.7799 Лучший результат
P1_last_token 0.7640 База (значительно хуже)

Важный инсайт: обнаружение ≠ управление

Ключевой негативный результат исследования: высокая способность к обнаружению концепта (D1) не гарантирует возможность его контроля (D2/D3). Для большинства концептов показатели управляемости и дезаплетирования значительно ниже. Это указывает на фундаментальные ограничения представлений в моделях, а не на ошибку выбора метода пулинга.

Практическая иерархия

Выбор метода конструирования (DiffMean vs. REPE) влияет на результат сильнее, чем сам пулинг: разница в AUROC составляет 0.15 против 0.016. Авторы опубликовали корпус, активации и код, чтобы стандартизировать дальнейшие исследования.

Источник: arXiv cs.CL ↗