Инструменты23 сентября 2026 г., 10:20 МСК🤖 Auto

WorkspaceBench: Новый стандарт оценки интерпретируемости LLM

Исследователи представили WorkspaceBench — первый бенчмарк для оценки способности методов интерпретируемости точно декодировать «глобальное рабочее пространство» моделей, на примере Qwen-3.6-27B.

Баннер новости 8087

Проблема «черного ящика» и отсутствие истины

Ключевая проблема интерпретируемости (interpretability) — невозможность проверить, действительно ли инструмент считывает внутренние состояния модели, или использует «костыли», такие как инверсия текста. Авторы WorkspaceBench решают эту проблему, создав набор из 3 356 вопросов в 27 категориях (логика, безопасность, многошаговые вычисления). Бенчмарк разработан специально для модели Qwen-3.6-27B, так как она обладает достаточно сложными внутренними репрезентациями для тестирования.

Сравнение методов: Single-Token vs Multi-Token

Исследование сравнивает два класса методов извлечения информации. Single-token методы выдают список токенов, а multi-token — свободный текст. Ниже приведена классификация протестированных инструментов:

Класс метода Название Принцип работы Ключевая особенность
Single-Token Logit Lens Прямое применение матрицы unembedding Без дообучения, базовый уровень
Single-Token J-Lens Якобиан для оценки линейного эффекта Высокая надежность, но только 1 токен
Single-Token R-Lens LRP (Layer-wise Relevance Propagation) Позволяет находить концепции раньше в сети
Single-Token Tuned Lens Аффинное преобразование + unembedding Обучается на минимизации KL-дивергенции
Multi-Token NLA (Natural Language Autoencoders) Мета-модель с текстовым узким горлышком Выразительность, но риск галлюцинаций
Multi-Token SAE (Sparse Autoencoders) Разложение на разреженные фичи Зависит от качества лейблов фич
Multi-Token Oracle Lens Мета-модель без фиксированного словаря Улучшенная версия Template Lens

Метрика: Точность против Галлюцинаций

Главный вывод исследования заключается в компромиссе (trade-off). Single-token методы (например, J-Lens) демонстрируют высокую точность, но не могут выразить сложные многошаговые мысли. Multi-token методы (NLA, Oracle Lens) способны описывать сложные концепции, но склонны к конфабуляциям (выдумыванию фактов). WorkspaceBench позволяет измерять эти метрики совместно, помогая выбрать инструмент для аудита безопасности или анализа логики.

Почему это важно?

По мере того как модели (как Astra) учатся решать задачи без явной цепочки рассуждений (Chain of Thought), интерпретируемость становится единственным способом контролировать их поведение. WorkspaceBench предоставляет открытый стандарт для проверки новых методов, позволяя исследователям объективно оценивать, насколько хорошо они «читают» намерения и алгоритмы работы нейросетей.

Источник: LessWrong ↗