От пассивной оценки к активному контролю
Большие языковые модели (LLM) часто предлагают помощь в сфере ментального здоровья, но их ответы могут быть небезопасными или неэмпатичными. Авторы исследования подчеркивают: качество терапии улучшается не за счет более мощных генеративных моделей, а когда оценка становится действенным сигналом для корректировки. Они представили фреймворк, где генерация ответа рассматривается как задача уточнения решения, управляемая многомерной человеческой оценкой.
Stage I: TheraJudge — ИИ-судья с клиническим опытом
Первый этап — создание TheraJudge, открытого оценщика, обученного на предпочтениях (preference-based optimization) с использованием аннотированных человеком данных. Модель оценивает ответы по 7 психологическим измерениям. Ключевая метрика успеха — согласие с оценками врачей-клиницистов. TheraJudge показал коэффициент внутриклассовой корреляции (ICC) в диапазоне 0.87–0.95, что превосходит как базовые supervised-модели, так и закрытые коммерческие аналоги, особенно в критических аспектах: Безопасность (Safety), Релевантность (Relevance) и Эмпатия (Empathy).
Stage II: TheraAgent — система исправления ошибок
Второй этап — TheraAgent, который использует оценки TheraJudge для многоагентной корректировки. Система координирует три роли:
- Critic (Критик): выявляет недостатки ответа.
- Coach (Наставник): предлагает конкретные направления улучшения.
- Therapist (Терапевт): переписывает ответ, интегрируя рекомендации.
Этот цикл позволяет трансформировать оценочные сигналы в целевые правки текста.
Результаты: безопасность и эмпатия
Слепая оценка людьми показала значительный прирост качества. Ниже приведены ключевые метрики эффективности системы TheraAgent по сравнению с базовыми моделями:
| Метрика | Результат / Изменение | Значение |
|---|---|---|
| Улучшение качества (5-балльная шкала) | +0.43 | Статистически значимый рост оценки экспертами |
| Надежность врачей (Inter-rater reliability) | 96% | Высокое согласие между клиницистами при оценке |
| Исправление низкокачественных ответов (≤3 балла) | +2.45 балла | Средний прирост качества «плохих» ответов |
| Коэффициент восстановления (Recovery rate) | 94% | Доля опасных/небезопасных ответов, исправленных системой |
Почему это важно
Результаты доказывают, что эффективное выравнивание (alignment) LLM в чувствительных сферах требует не просто «более умной» генерации, а внедрения механизмов обратной связи, основанных на человеческих ценностях. Система TheraAgent демонстрирует, как можно автоматически исправлять токсичные или некорректные выводы, повышая безопасность пользователей. Код проекта опубликован исследователями для открытого использования.
Источник: arXiv cs.CL ↗
