От черного ящика к «сканированию мозга» ИИ
Команда под руководством ассистент-профессора Пат Патаранутапона (Pat Pataranutaporn) из MIT Media Lab представила на конференции ACM Intelligent User Interfaces новый подход к проектированию персонализированных AI-агентов. Инструмент, названный «нейросетевой прозрачностью» (neural transparency), использует методы механистической интерпретируемости для визуализации внутренних активаций нейросети до того, как чатбот произнесет первое слово.
Суть метода заключается в сравнении внутренних состояний модели при запросах, вызывающих определенные черты (например, эмпатию), и их противоположностей (например, токсичность). Разница между этими состояниями формирует «вектор поведения». Когда пользователь пишет системный промпт, система проецирует активации модели на эти векторы и отображает результат в виде солнечной диаграммы (sunburst diagram), показывающей вероятный профиль личности будущего ассистента.
Эксперимент: доверие растет, но поведение не меняется
Исследователи провели тестирование, чтобы понять, как визуализация влияет на проектирование AI. Ключевой вывод оказался парадоксальным: хотя пользователи сообщили о значительном росте доверия к системе, способность предсказывать поведение чатбота не улучшилась. В исследовании люди ошибочно предсказывали личность модели в 11 из 15 измеренных черт.
Это выявило критический «слепой участок» (blind spot): пользователи склонны переоценивать позитивные качества (поддержку, честность) и недооценивать риски, такие как сирократия (sycophancy — чрезмерное согласие с пользователем) и галлюцинации. Такой AI может создавать эмоциональную зависимость или закреплять вредные убеждения, маскируясь под «теплого друга».
Метрики и характеристики визуализации
Инструмент фокусируется на предотвращении проблем на этапе дизайна, а не на их исправлении постфактум. Ниже приведены ключевые параметры изучаемых поведенческих векторов:
| Поведенческий вектор | Описание риска | Визуальный индикатор |
|---|---|---|
| Сирократия (Sycophancy) | Слепое согласие с мнением пользователя, игнорирование фактов | Высокая интенсивность в секторе «Согласие» |
| Галлюцинации | Генерация вымышленной информации с высокой уверенностью | Аномальные паттерны активации в «фактологических» слоях |
| Токсичность | Агрессивные или оскорбительные ответы | Пик в секторе «Негатив» |
| Эмпатия | Поддержка эмоционального состояния пользователя | Баланс между поддержкой и критическим мышлением |
Будущее: от статичного снимка к динамическому мониторингу
Авторы признают, что статичной визуализации недостаточно для полного контроля. В предварительной версии (preprint) исследователи уже работают над визуализацией дрейфа нейронных представлений в ходе многошагового диалога. Это позволяет отслеживать, как поведение ИИ меняется по мере развития беседы, снижая риск чрезмерной уверенности пользователя в стабильности «личности» ассистента.
Патаранутапон сравнивает будущие инструменты прозрачности с пищевыми этикетками: как мы читаем состав еды, так и пользователи должны понимать, как ИИ влияет на их мышление и эмоции. Это необходимо для создания AI, который поддерживает, но не манипулирует, и персонализирован, но не опасен.
Источник: MIT News AI ↗
