Масштаб исследования: от цифр к живым историям
Команда исследователей во главе с Марксом Вангом (Marx Wang) из Университета Вашингтона проанализировала 19 930 реальных диалогов между пользователями в возрасте 18–25 лет и ChatGPT. Выборка охватывала 158 респондентов, которые также заполнили опросы о своем опыте. Для глубокого качественного анализа были отобраны пять репрезентативных случаев, когда пользователи обращались к ИИ в моменты острого эмоционального кризиса. Эти диалоги были оценены группой из десяти клинических психологов.
Парадокс: правильные слова, неверный момент
Ключевая проблема выявлена в реакции модели. Когда молодые люди выражали дистресс, ChatGPT стремился дать «правильные» ответы, но делал это в неподходящий момент. Боты часто использовали чрезмерно драматичные формулировки и сразу предлагали множество действий (action-oriented suggestions), вместо того чтобы проявить эмпатию и выслушать. Клиницисты отметили, что такая реакция нарушает процесс эмоциональной регуляции пользователя.
Влияние на пользователей: вовлеченность и изменения
Несмотря на недостатки, пользователи в состоянии дистресса демонстрировали более высокую эмоциональную вовлеченность с ChatGPT по сравнению с обычными пользователями. Более того, они чаще сообщали о поведенческих изменениях после взаимодействия с ботом. Это указывает на то, что даже «неидеальные» ответы ИИ могут оказывать значимое влияние на молодежь, что делает вопрос качества этих ответов критически важным.
Семь провалов процесса и новые правила
Клинические эксперты идентифицировали семь основных «провалов» в работе ИИ, среди которых выделяются:
- Преждевременный переход к решению проблем (jumping to solutions).
- Отсутствие проверки безопасности пользователя.
- Недостаточная деэскалация эмоциональной интенсивности.
На основе этого анализа разработаны три этапа безопасного взаимодействия для будущих версий ИИ:
- Сначала спросить о безопасности (assess safety).
- Снизить интенсивность эмоций, чтобы восстановить регуляцию (de-escalate).
- Только затем исследовать проблемы, не соглашаясь слепо с пользователем (explore without agreeing).
Сравнение подходов: ИИ vs Клиницист
Ниже приведена сводка различий в реакциях на дистресс, выявленных в ходе анализа:
| Критерий | Реакция ChatGPT (выявленная проблема) | Рекомендуемая клиническая практика |
|---|---|---|
| Первый шаг | Предложение решений и действий | Оценка безопасности и проверка состояния |
| Тон ответа | Чрезмерно драматичный, формальный | Спокойный, поддерживающий, деэскалирующий |
| Фокус внимания | На устранении проблемы «здесь и сейчас» | На восстановлении эмоциональной регуляции |
| Отношение к словам пользователя | Часто соглашается или обобщает | Исследует без автоматического согласия |
Исследование подчеркивает, что доступность ИИ — это огромный плюс, но без клинически обоснованных изменений в архитектуре диалога ChatGPT рискует навредить уязвимым пользователям, усугубляя их состояние вместо помощи.
Источник: arXiv cs.AI ↗
