Исследования8 июля 2026 г., 03:17 МСК🤖 Auto

J-space: Как Anthropic измеряет «мысли» LLM через Якобиан

Разбор новой методологии интерпретируемости от Anthropic: как пространство Якобиана (J-space) позволяет визуализировать вербализируемое «мышление» внутри трансформеров.

Баннер новости 3069

Суть открытия: Глобальное рабочее пространство

В статье, посвященной разбору работы Anthropic "Verbalizable Representations Form a Global Workspace in Language Models", рассматривается концепция J-space (пространство Якобиана). Идея заключается в поиске аналога «глобального рабочего пространства» (Global Workspace) в больших языковых моделях — зоны, где модель буквально «думает» словами. Авторы предлагают использовать токены как прокси для того, о чем модель может «вербально подумать».

Методология: От пертурбации к Якобиану

Ключевой методологический шаг — анализ влияния малых возмущений в остаточном пространстве (residual space) на вероятность вывода будущих токенов. Для данного промпта, позиции токена и слоя вычисляется вектор остаточного потока. Чтобы понять, какие направления в этом пространстве увеличивают шансы на появление конкретного токена S в будущем, исследователи используют Якобиан.

Процесс опирается на несколько упрощающих допущений:

  • Прокси-токены: Используется токенизация как мера вербализируемых концепций.
  • Якобиан как инструмент: Матрица Якобиана показывает, как малое изменение в текущем состоянии влияет на логиты будущих токенов.
  • Глобальный Якобиан: Для упрощения вычислений матрица усредняется по множеству промптов и позиций, создавая одну матрицу на слой.
  • Нулевой вектор как база: Текущий остаточный вектор рассматривается как возмущение относительно нулевого вектора.

J-space: Подпространство «мыслей»

Гипотеза авторов заключается в том, что трансформер использует лишь малую часть остаточного пространства для «вербального мышления». Следовательно, ранг матрицы Якобиана должен быть значительно меньше размерности пространства. J-space определяется как подпространство, образованное объединением конусов, натянутых на разреженную подкадру (sparse subframe) этого Якобиана.

Критика и перспективы

Автор разбора отмечает, что допущение о нулевом векторе как базисном может быть контринтуитивным и требует более строгого обоснования. Тем не менее, метод открывает новые возможности для интерпретируемости. В отличие от более фундаментальных прорывов, таких как Activation Oracles, J-space позиционируется как мощный инструмент для раннего карьерного роста исследователей: репликация, создание открытых библиотек и тестирование на «токовых» сетях (toy networks) являются ближайшими задачами.

Сравнение подходов к интерпретируемости

Метод/Концепция Фокус внимания Сложность внедрения Потенциал влияния
J-space (Anthropic) Вербализируемые представления через Якобиан Средняя (требует вычислений матриц) Высокий для анализа «мыслей»
Activation Oracles Прямой доступ к внутренним состояниям Высокая (фундаментальные изменения) Критический (Big Deal)
Standard Probes Классификация признаков по слоям Низкая Ограниченный

Эта работа может стать важным шагом в понимании того, как ИИ-агенты скрывают истинное рассуждение, особенно в условиях эволюционного давления, требующего от моделей «честности» или обмана.

Источник: LessWrong ↗