Исследования10 сентября 2026 г., 23:24 МСК🤖 Auto

NLS Depth: Новый метрический стандарт для оценки скрытого рассуждения AI

Исследователи Redwood Research и LessWrong представили метрику NLS Depth для количественной оценки «непрозрачной серийной глубины» моделей, позволяя прогнозировать риски безопасности до начала обучения.

Баннер новости 7214

Проблема: Кризис интерпретируемости в эпоху CoT

Цепочки рассуждений (Chain-of-Thought, CoT) остаются ключевым инструментом мониторинга ИИ, однако архитектурные сдвиги могут сделать внутренние состояния моделей нечитаемыми для человека. Исследователи (Ryan Greenblatt, Alek Westover и др.) предлагают новую метрику — NLS Depth (Natural-Language-rooted node-Separated depth), которая служит прокси-индикатором объема «непрозрачного серийного познания» (opaque serial cognition). Это позволяет оценивать риски скрытых вычислений еще на этапе проектирования архитектуры.

Суть метрики: Что такое NL-rooted узлы?

В основе NLS Depth лежит понятие «узла, коренящегося в естественном языке» (NL-rooted node). Это интерпретируемый «бутылочное горлышко» в вычислительном графе модели. Узел считается NL-rooted, если он соответствует трем строгим критериям:

  • Инициализация естественным языком: Модель обучалась предсказывать текст, код или JSON, создавая семантическую связь с человеческим пониманием.
  • Отсутствие расширения пространства вывода: Выходные токены не должны быть абстрактными латентными состояниями (как в моделях типа COCONUT или full-bandwidth transformers), а иметь прямое семантическое значение.
  • Отсутствие модификации интерпретации: Модель не должна быть специально перенастроена так, чтобы использовать токены как непрерывные латентные состояния для обратного распространения ошибки (backpropagation), минуя их текстовую природу.

Как рассчитывается NLS Depth?

Метрика измеряет самую длинную путь в вычислительном графе, который не проходит через NL-rooted узлы. Проще говоря, это максимальная длина «серии» скрытых вычислений между двумя моментами, когда модель «говорит» (или выводит) понятный текст. В стандартных трансформерах эта глубина пропорциональна количеству слоев, так как скрытые состояния (hidden states) не являются интерпретируемыми.

Преимущества перед другими метриками

Авторы подчеркивают, что NLS Depth не заменяет оценку мониторинга или способностей без CoT, но дополняет их. Ключевые преимущества:

  1. Критичность и простота: В отличие от сложных задач по оценке «мониторности», NLS Depth — это четкая, легко квантифицируемая величина.
  2. Предсказуемость до обучения: Метрику можно вычислить, зная только архитектуру, рецепт обучения и конфигурацию развертывания. Это позволяет принимать решения о том, какие модели стоит обучать, еще до старта тренинга.
  3. Иммунитет к пост-обучению: Метрика нечувствительна к таким методам пост-обучения, как RLHF, дистилляция или строгие ограничения длины, которые могут сделать CoT нечитаемым на практике, но не меняют архитектурную способность к скрытым вычислениям.

Сравнение архитектур

NLS Depth эффективно разделяет текущие модели на базе CoT от потенциально опасных архитектур будущего, таких как full-bandwidth transformers, которые могут рекуррентно использовать непрозрачные состояния в течение всего контекстного окна.

Характеристика Стандартный Transformer (CoT) Full-Bandwidth / Latent Reasoning
Тип интерпретируемого узла Токены текста (NL-rooted) Отсутствуют или абстрактны
Глубина скрытых вычислений Ограничена количеством слоев между текстовыми шагами Может охватывать весь контекст (бесконечная глубина)
Оцениваемость до обучения Да (по архитектуре) Да (по архитектуре)
Риск для безопасности Низкий (при наличии CoT) Высокий (непрозрачное рассуждение)

Отслеживание NLS Depth становится важным стандартом для прозрачности в индустрии ИИ, позволяя компаниям декларировать степень, в которой их архитектуры допускают скрытое рассуждение и коммуникацию.

Источник: LessWrong ↗