Исследования1 июля 2026 г., 18:18 МСК🤖 Auto

TheraJudge и TheraAgent: как ИИ-судьи спасают от токсичных ответов в психотерапии

Исследователи представили систему TheraAgent, которая использует обученный оценщик TheraJudge для исправления ответов LLM. Система повысила качество поддержки на 0.43 балла и снизила риск опасных рекомендаций.

Баннер новости 2749

От пассивной оценки к активному контролю

Большие языковые модели (LLM) часто предлагают помощь в сфере ментального здоровья, но их ответы могут быть небезопасными или неэмпатичными. Авторы исследования подчеркивают: качество терапии улучшается не за счет более мощных генеративных моделей, а когда оценка становится действенным сигналом для корректировки. Они представили фреймворк, где генерация ответа рассматривается как задача уточнения решения, управляемая многомерной человеческой оценкой.

Stage I: TheraJudge — ИИ-судья с клиническим опытом

Первый этап — создание TheraJudge, открытого оценщика, обученного на предпочтениях (preference-based optimization) с использованием аннотированных человеком данных. Модель оценивает ответы по 7 психологическим измерениям. Ключевая метрика успеха — согласие с оценками врачей-клиницистов. TheraJudge показал коэффициент внутриклассовой корреляции (ICC) в диапазоне 0.87–0.95, что превосходит как базовые supervised-модели, так и закрытые коммерческие аналоги, особенно в критических аспектах: Безопасность (Safety), Релевантность (Relevance) и Эмпатия (Empathy).

Stage II: TheraAgent — система исправления ошибок

Второй этап — TheraAgent, который использует оценки TheraJudge для многоагентной корректировки. Система координирует три роли:

  • Critic (Критик): выявляет недостатки ответа.
  • Coach (Наставник): предлагает конкретные направления улучшения.
  • Therapist (Терапевт): переписывает ответ, интегрируя рекомендации.

Этот цикл позволяет трансформировать оценочные сигналы в целевые правки текста.

Результаты: безопасность и эмпатия

Слепая оценка людьми показала значительный прирост качества. Ниже приведены ключевые метрики эффективности системы TheraAgent по сравнению с базовыми моделями:

Метрика Результат / Изменение Значение
Улучшение качества (5-балльная шкала) +0.43 Статистически значимый рост оценки экспертами
Надежность врачей (Inter-rater reliability) 96% Высокое согласие между клиницистами при оценке
Исправление низкокачественных ответов (≤3 балла) +2.45 балла Средний прирост качества «плохих» ответов
Коэффициент восстановления (Recovery rate) 94% Доля опасных/небезопасных ответов, исправленных системой

Почему это важно

Результаты доказывают, что эффективное выравнивание (alignment) LLM в чувствительных сферах требует не просто «более умной» генерации, а внедрения механизмов обратной связи, основанных на человеческих ценностях. Система TheraAgent демонстрирует, как можно автоматически исправлять токсичные или некорректные выводы, повышая безопасность пользователей. Код проекта опубликован исследователями для открытого использования.

Источник: arXiv cs.CL ↗