Проблема «черного ящика» и отсутствие истины
Ключевая проблема интерпретируемости (interpretability) — невозможность проверить, действительно ли инструмент считывает внутренние состояния модели, или использует «костыли», такие как инверсия текста. Авторы WorkspaceBench решают эту проблему, создав набор из 3 356 вопросов в 27 категориях (логика, безопасность, многошаговые вычисления). Бенчмарк разработан специально для модели Qwen-3.6-27B, так как она обладает достаточно сложными внутренними репрезентациями для тестирования.
Сравнение методов: Single-Token vs Multi-Token
Исследование сравнивает два класса методов извлечения информации. Single-token методы выдают список токенов, а multi-token — свободный текст. Ниже приведена классификация протестированных инструментов:
| Класс метода | Название | Принцип работы | Ключевая особенность |
|---|---|---|---|
| Single-Token | Logit Lens | Прямое применение матрицы unembedding | Без дообучения, базовый уровень |
| Single-Token | J-Lens | Якобиан для оценки линейного эффекта | Высокая надежность, но только 1 токен |
| Single-Token | R-Lens | LRP (Layer-wise Relevance Propagation) | Позволяет находить концепции раньше в сети |
| Single-Token | Tuned Lens | Аффинное преобразование + unembedding | Обучается на минимизации KL-дивергенции |
| Multi-Token | NLA (Natural Language Autoencoders) | Мета-модель с текстовым узким горлышком | Выразительность, но риск галлюцинаций |
| Multi-Token | SAE (Sparse Autoencoders) | Разложение на разреженные фичи | Зависит от качества лейблов фич |
| Multi-Token | Oracle Lens | Мета-модель без фиксированного словаря | Улучшенная версия Template Lens |
Метрика: Точность против Галлюцинаций
Главный вывод исследования заключается в компромиссе (trade-off). Single-token методы (например, J-Lens) демонстрируют высокую точность, но не могут выразить сложные многошаговые мысли. Multi-token методы (NLA, Oracle Lens) способны описывать сложные концепции, но склонны к конфабуляциям (выдумыванию фактов). WorkspaceBench позволяет измерять эти метрики совместно, помогая выбрать инструмент для аудита безопасности или анализа логики.
Почему это важно?
По мере того как модели (как Astra) учатся решать задачи без явной цепочки рассуждений (Chain of Thought), интерпретируемость становится единственным способом контролировать их поведение. WorkspaceBench предоставляет открытый стандарт для проверки новых методов, позволяя исследователям объективно оценивать, насколько хорошо они «читают» намерения и алгоритмы работы нейросетей.
Источник: LessWrong ↗
