Исследования10 сентября 2026 г., 22:18 МСК🤖 Auto

Нейросети на «нейроязыке»: почему пороговые нормы безопасности провалились

Эксперт Linch анализирует скандал вокруг модели Astra от OpenAI, доказывая, что отказ от четких категорий в пользу размытых числовых порогов делает контроль над ИИ невозможным.

Баннер новости 7209

Суть конфликта: Astra и проблема «нейроязыка»

В центре дискуссии — использование моделями внутреннего самовыражения на «нейроязыке» (neuralese) вместо естественного языка. В архитектуре трансформеров поток внимания между слоями при прямом проходе (forward pass) уже трудно интерпретируем человеком. Однако ключевой вопрос безопасности — это наличие рекурсии (самообсуждения) в таком скрытом формате. Возникло два подхода к определению нарушения:

  • Категориальный запрет: Любое использование рекурсии в скрытом представлении (нейроязыке) считается нарушением, так как это ломает стандартный цикл CoT (Chain of Thought) на естественном языке.
  • Пороговый запрет: Нарушением считается только превышение определенного числа последовательных шагов (слоев) до возврата к естественному языку.

Почему пороговые нормы не работают

Автор указывает, что технические эксперты (включая сотрудников компаний) часто предпочитают пороговый подход, считая его более «причинно-следственным». Однако на практике это приводит к парадоксу: если порог X не установлен публично, а количество слоев в проприетарных моделях (как Astra) неизвестно, то любой обход запрета через добавление слоев не выглядит как явное нарушение. Это создает ситуацию, когда «скоростной лимит без цифры — это не лимит вовсе.

Аналогии: Ядерное оружие и допинг

Для иллюстрации приводятся две аналогии:

h>Сфера
Категориальный подход Пороговый подход Результат
Ядерное оружие Запрет на использование любого ядерного оружия (даже тактического) Запрет на бомбы выше определенной мощности Пороговый подход не имеет «фокальной точки» — после первого тактического удара нет естественного места, чтобы остановиться.
Спорт (допинг) Запрет на любые запрещенные вещества Запрет при превышении концентрации вещества в крови Порог — это прокси. Лэнс Армстронг мог «не сдать тест», но нарушал дух нормы. Регуляторы должны наказывать за нарушение духа, а не только буквы закона.

Вывод для индустрии ИИ

OpenAI аргументировала использование скрытых слоев тем, что общая глубина вычислений Astra невелика. Однако автор считает, что это игнорирует суть запрета. Использование «нейроязыка» — это нарушение табу, даже если оно «менее вредное», чем полный отказ от прозрачности. Для обеспечения безопасности необходимы четкие, категориальные нормы, а не размытые числовые пороги, которые легко обойти технически, но невозможно контролировать социально.

Источник: LessWrong ↗