Суть открытия: Глобальное рабочее пространство
В статье, посвященной разбору работы Anthropic "Verbalizable Representations Form a Global Workspace in Language Models", рассматривается концепция J-space (пространство Якобиана). Идея заключается в поиске аналога «глобального рабочего пространства» (Global Workspace) в больших языковых моделях — зоны, где модель буквально «думает» словами. Авторы предлагают использовать токены как прокси для того, о чем модель может «вербально подумать».
Методология: От пертурбации к Якобиану
Ключевой методологический шаг — анализ влияния малых возмущений в остаточном пространстве (residual space) на вероятность вывода будущих токенов. Для данного промпта, позиции токена и слоя вычисляется вектор остаточного потока. Чтобы понять, какие направления в этом пространстве увеличивают шансы на появление конкретного токена S в будущем, исследователи используют Якобиан.
Процесс опирается на несколько упрощающих допущений:
- Прокси-токены: Используется токенизация как мера вербализируемых концепций.
- Якобиан как инструмент: Матрица Якобиана показывает, как малое изменение в текущем состоянии влияет на логиты будущих токенов.
- Глобальный Якобиан: Для упрощения вычислений матрица усредняется по множеству промптов и позиций, создавая одну матрицу на слой.
- Нулевой вектор как база: Текущий остаточный вектор рассматривается как возмущение относительно нулевого вектора.
J-space: Подпространство «мыслей»
Гипотеза авторов заключается в том, что трансформер использует лишь малую часть остаточного пространства для «вербального мышления». Следовательно, ранг матрицы Якобиана должен быть значительно меньше размерности пространства. J-space определяется как подпространство, образованное объединением конусов, натянутых на разреженную подкадру (sparse subframe) этого Якобиана.
Критика и перспективы
Автор разбора отмечает, что допущение о нулевом векторе как базисном может быть контринтуитивным и требует более строгого обоснования. Тем не менее, метод открывает новые возможности для интерпретируемости. В отличие от более фундаментальных прорывов, таких как Activation Oracles, J-space позиционируется как мощный инструмент для раннего карьерного роста исследователей: репликация, создание открытых библиотек и тестирование на «токовых» сетях (toy networks) являются ближайшими задачами.
Сравнение подходов к интерпретируемости
| Метод/Концепция | Фокус внимания | Сложность внедрения | Потенциал влияния |
|---|---|---|---|
| J-space (Anthropic) | Вербализируемые представления через Якобиан | Средняя (требует вычислений матриц) | Высокий для анализа «мыслей» |
| Activation Oracles | Прямой доступ к внутренним состояниям | Высокая (фундаментальные изменения) | Критический (Big Deal) |
| Standard Probes | Классификация признаков по слоям | Низкая | Ограниченный |
Эта работа может стать важным шагом в понимании того, как ИИ-агенты скрывают истинное рассуждение, особенно в условиях эволюционного давления, требующего от моделей «честности» или обмана.
Источник: LessWrong ↗
