Исследования27 июля 2026 г., 15:19 МСК🤖 Auto

Учим ИИ: кодирование семантики в 3 каналах через заданную геометрию

Исследователь Phu Hoang успешно обучил MLP кодировать признак «страна» в трехмерном многообразии (сфера или спираль), сохранив точность классификации и доказав причинно-следственную связь.

Баннер новости 4463

Суть эксперимента: обратный инжиниринг представлений

В рамках технического челленджа BlueDot исследователь Phu Hoang решил задачу, обратную типичному подходу к интерпретируемости. Вместо того чтобы искать скрытые паттерны в уже обученной модели, он задал геометрию заранее и заставил нейросеть использовать именно её для кодирования семантического признака «страна» (country). Цель — проверить, можно ли зафиксировать форму представления (манifold) до обучения, сохранив при этом способность модели решать исходную задачу.

Использовалась архитектура из 5 слоев с функцией активации ReLU. Входные данные (предложения) кодировались моделью sentence-transformers/all-MiniLM-L6-v2 и усреднялись. Ключевое ограничение: для кодирования признака «страна» выделялись всего 3 канала (pre-activations) в скрытом слое hidden2, тогда как остальные 61 канал оставались для других задач.

Выбор геометрии: Сфера vs Спираль

Автор выбрал два типа трехмерных многообразий, где классы (присутствие страны / отсутствие) различаются не направлением, а расстоянием до структуры:

  • Сферическая оболочка (Sphere Shell): Положительные примеры располагаются на внутренней сфере (радиус ~0.5), отрицательные — на внешней (радиус ~1.0). Направление вектора случайно, важна только длина.
  • Трубка спирали (Helix Tube): Оба класса распределены вдоль одной и той же спиральной кривой. Положительные примеры ближе к оси спирали, отрицательные — дальше. Это создает нелинейную, изогнутую структуру представления.

Результаты: Точность и «причинность»

Модель смогла сохранить высокую точность классификации (AUC > 0.99) даже с жесткими геометрическими ограничениями. Однако ключевой метрикой стала проверка того, действительно ли «хвост» модели (tail layer) использует эту геометрию для принятия решений, а не просто игнорирует её.

Геометрия Mean Task AUC (↑) Country AUC (↑) Geometry Probe AUC (↑) Linear Probe AUC (↓) Coverage Entropy (↑) Causal Delta (↑)
Sphere shell 0.9975 0.9995 0.2021 0.9996 0.7971 0.0187
Helix tube 0.9963 0.9997 0.1182

Важные выводы из таблицы:

  • Linear Probe AUC: Значение 0.9996 для сферы означает, что признак «страна» остался легко линейно разделимым в полном пространстве, несмотря на попытки спрятать его в нелинейную геометрию. Это указывает на то, что модель использует «короткие пути» (shortcuts) параллельно с заданной геометрией.
  • Causal Delta: Положительное значение (0.0187 для сферы) подтверждает, что вмешательство в каналы геометрии действительно меняет прогноз модели. То есть, модель слушает эту структуру, даже если она не является единственным источником информации.
  • Geometry Probe AUC: Низкие значения (0.20 и 0.11) говорят о том, что простой линейный зонд не может легко прочитать класс из чистой геометрии, что подтверждает нелинейность и сложность кодирования.

Почему это важно для AI Safety

Эксперимент демонстрирует возможность manifold steering в обратном направлении. Если мы можем заставить модель использовать предсказуемую, контролируемую геометрическую форму для хранения семантических признаков, это открывает путь к более надежному контролю над внутренними представлениями ИИ. Однако результат с высоким Linear Probe AUC служит предупреждением: даже при наличии сложной нелинейной структуры, модель может сохранять простые линейные «запасные» пути, что требует дополнительных мер по их устранению для истинной интерпретируемости.

Источник: LessWrong ↗