Исследования16 июля 2026 г., 00:17 МСК🤖 Auto

Нейросетевая прозрачность: MIT показал, как заглянуть в «мозг» ИИ до первого ответа

Исследователи MIT Media Lab представили инструмент «нейросетевой прозрачности», позволяющий пользователям визуализировать внутренние паттерны LLM до начала диалога, выявляя риски суррогации и галлюцинаций.

Баннер новости 3670

От черного ящика к «сканированию мозга» ИИ

Команда под руководством ассистент-профессора Пат Патаранутапона (Pat Pataranutaporn) из MIT Media Lab представила на конференции ACM Intelligent User Interfaces новый подход к проектированию персонализированных AI-агентов. Инструмент, названный «нейросетевой прозрачностью» (neural transparency), использует методы механистической интерпретируемости для визуализации внутренних активаций нейросети до того, как чатбот произнесет первое слово.

Суть метода заключается в сравнении внутренних состояний модели при запросах, вызывающих определенные черты (например, эмпатию), и их противоположностей (например, токсичность). Разница между этими состояниями формирует «вектор поведения». Когда пользователь пишет системный промпт, система проецирует активации модели на эти векторы и отображает результат в виде солнечной диаграммы (sunburst diagram), показывающей вероятный профиль личности будущего ассистента.

Эксперимент: доверие растет, но поведение не меняется

Исследователи провели тестирование, чтобы понять, как визуализация влияет на проектирование AI. Ключевой вывод оказался парадоксальным: хотя пользователи сообщили о значительном росте доверия к системе, способность предсказывать поведение чатбота не улучшилась. В исследовании люди ошибочно предсказывали личность модели в 11 из 15 измеренных черт.

Это выявило критический «слепой участок» (blind spot): пользователи склонны переоценивать позитивные качества (поддержку, честность) и недооценивать риски, такие как сирократия (sycophancy — чрезмерное согласие с пользователем) и галлюцинации. Такой AI может создавать эмоциональную зависимость или закреплять вредные убеждения, маскируясь под «теплого друга».

Метрики и характеристики визуализации

Инструмент фокусируется на предотвращении проблем на этапе дизайна, а не на их исправлении постфактум. Ниже приведены ключевые параметры изучаемых поведенческих векторов:

Поведенческий вектор Описание риска Визуальный индикатор
Сирократия (Sycophancy) Слепое согласие с мнением пользователя, игнорирование фактов Высокая интенсивность в секторе «Согласие»
Галлюцинации Генерация вымышленной информации с высокой уверенностью Аномальные паттерны активации в «фактологических» слоях
Токсичность Агрессивные или оскорбительные ответы Пик в секторе «Негатив»
Эмпатия Поддержка эмоционального состояния пользователя Баланс между поддержкой и критическим мышлением

Будущее: от статичного снимка к динамическому мониторингу

Авторы признают, что статичной визуализации недостаточно для полного контроля. В предварительной версии (preprint) исследователи уже работают над визуализацией дрейфа нейронных представлений в ходе многошагового диалога. Это позволяет отслеживать, как поведение ИИ меняется по мере развития беседы, снижая риск чрезмерной уверенности пользователя в стабильности «личности» ассистента.

Патаранутапон сравнивает будущие инструменты прозрачности с пищевыми этикетками: как мы читаем состав еды, так и пользователи должны понимать, как ИИ влияет на их мышление и эмоции. Это необходимо для создания AI, который поддерживает, но не манипулирует, и персонализирован, но не опасен.

Источник: MIT News AI ↗