Суть явления: суперпозиция вместо изоляции
Полисемантичность (polysemanticity) — это фундаментальное свойство современных языковых моделей, при котором один нейрон активируется в ответ на множество различных, часто не связанных между собой концепций. Это не баг, а следствие суперпозиции: когда количество возможных входных состояний (слов, кодовых конструкций, смыслов) превышает количество доступных нейронов, модель вынуждена «упаковывать» несколько признаков в один вектор представления.
Ключевой вывод: нейрон редко отвечает за единственное понятие. Вместо этого он является частью группы, где итоговое значение формируется суммарной активацией нескольких нейронов, а не активацией одного изолированного элемента.
Механизм на примерах: от кода до имен
Автор статьи приводит два наглядных примера работы полисемантичности в ранних слоях трансформеров:
- Код против литературы: Если у модели есть 25 нейронов, каждый из них может активироваться либо на фрагмент Python-кода, либо на отрывок из классического романа. Сам по себе факт активации нейрона не говорит, что именно произошло. Нужен 26-й «нейрон-индикатор домена», который, суммируясь с предыдущими, дает четкий ответ: это код или текст.
- Составные имена: Слова «Michael» и «Jordan» по отдельности неопределенны. Но вместе они образуют уникальный токен. Поскольку нейронов в ранних слоях меньше, чем всех возможных составных слов в английском языке, один и тот же нейрон может участвовать в кодировании и «Michael Jordan», и «Taylor Swift». Различие создается не самим нейроном, а паттерном его активации в сочетании с другими.
Проблема для интерпретируемости (Interpretability)
Полисемантичность создает серьезные трудности для механистической интерпретируемости (MI). Стандартные методы зондирования (probing), которые проверяют нейроны по одному, дают ложные результаты. Исследователь может ошибочно приписать нейрону функцию кодирования конкретного признака, хотя на самом деле этот нейрон лишь один из многих участников процесса.
| Метод зондирования | Как работает | Результат при полисемантичности |
|---|---|---|
| Последовательное (Sequential) | Проверка активации нейронов по одному | Неясность: активация одного нейрона не определяет концепцию из-за суперпозиции |
| Непрерывное (Continuous) | Анализ суммарного вклада группы нейронов в логиты | Точность: позволяет увидеть, какой набор нейронов совместно формирует представление |
Почему это важно для безопасности ИИ
Полисемантичность — это палка о двух концах. С одной стороны, она экономит ресурсы, позволяя модели хранить больше знаний в ограниченной архитектуре. Без нее некоторые концепции пришлось бы «выбросить» ради более важных. С другой стороны, она делает внутреннюю логику модели «мутной». Невозможность изолировать конкретный нейрон, отвечающий за опасный или специфический паттерн, затрудняет аудит безопасности и понимание причин принятия решений моделью. Это требует пересмотра метрик оценки и более сложных методов анализа внутренних представлений.
Источник: LessWrong ↗