Проблема: хаос в оценке концептов
В работе с decoder-only LLM (таких как Llama, Gemma, Mistral) критическим, но часто игнорируемым шагом является пулинг — сжатие токенов в единый вектор представления концепта. До сих пор исследователи сравнивали результаты, меняя одновременно датасеты, слои нейросетей и методы пулинга, что делало выводы ненадежными. PoolBench — это первый бенчмарк, изолирующий пулинг как единственную переменную.
Методология: строгий контроль
Авторы создали единый аудированный корпус из 37 693 реальных текстовых отрывков. Тестирование проводилось на трех открытых моделях: Llama-3.1-8B, Gemma-2-9B и Mistral-7B. Были протестированы 19 стратегий пулинга для 17 концептов. Основной метрикой стала линейная разделимость (D1/AUROC), дополнительные — управляемость (D2/SCP) и дезаплетирование вывода (D3).
Результаты: W4_hierarchical побеждает
Стратегия W4_hierarchical показала наилучшие результаты, достигнув среднего AUROC 0.7799. Классический подход P1_last_token (взятие состояния последнего токена) оказался статистически значимо хуже (p = 2.0e-36), набрав лишь 0.7640. На задачах средней сложности разрыв достигал 0.042–0.113 AUROC.
| Стратегия | Средний AUROC (D1) | Статус |
|---|---|---|
| W4_hierarchical | 0.7799 | Лучший результат |
| P1_last_token | 0.7640 | База (значительно хуже) |
Важный инсайт: обнаружение ≠ управление
Ключевой негативный результат исследования: высокая способность к обнаружению концепта (D1) не гарантирует возможность его контроля (D2/D3). Для большинства концептов показатели управляемости и дезаплетирования значительно ниже. Это указывает на фундаментальные ограничения представлений в моделях, а не на ошибку выбора метода пулинга.
Практическая иерархия
Выбор метода конструирования (DiffMean vs. REPE) влияет на результат сильнее, чем сам пулинг: разница в AUROC составляет 0.15 против 0.016. Авторы опубликовали корпус, активации и код, чтобы стандартизировать дальнейшие исследования.
Источник: arXiv cs.CL ↗
