Исследования18 августа 2026 г., 09:18 МСК🤖 Auto

LLM для советов родителям: 15 моделей, 100 сценариев и скрытые риски

Исследование оценило 15 крупных языковых моделей на предмет качества советов родителям, выявив критические пробелы в эмпатии и культурной чувствительности.

Баннер новости 5975

Проблема агрегированных метрик

Традиционные бенчмарки часто скрывают реальные проблемы при оценке LLM в социально чувствительных доменах. Исследование авторов Yunke Zhao, Isobel Voysey и коллег показывает, что средние баллы могут маскировать специфические слабости моделей. Для оценки использовалась многомерная рубрика, разработанная экспертами в области воспитания, что позволило учесть не только фактологическую точность, но и реляционные, поведенческие аспекты ответов.

Методология: 100 сценариев и LLM-as-a-judge

Команда протестировала 15 различных LLM на 100 сценариях из реальной жизни родителей. Оценка проводилась на двух языках — английском и китайском. В качестве судьи использовалась методология "LLM-as-a-judge", где одна модель оценивала ответы других, что позволяет масштабировать проверку качества. Ключевым требованием стала аудируемость результатов оценки, чтобы можно было отследить, почему модель получила ту или иную оценку.

Ключевые находки

Анализ выявил три критических инсайта:

  • Скрытые слабости: Высокий общий балл не гарантирует безопасности или уместности совета в конкретной ситуации. Модель может отлично справляться с фактами, но проваливать задачу эмоциональной поддержки.
  • Влияние языка: Язык ввода существенно влияет на стиль и содержание ответа. Различия между английскими и китайскими ответами указывают на то, что модели по-разному интерпретируют культурные нормы воспитания в зависимости от языка.
  • Имплицитные стили воспитания: Модели неявно продвигают определенные стили воспитания (например, авторитарный или демократический), что может быть неочевидно для пользователя, но критично для формирования родительских установок.

Значение для индустрии

Результаты исследования подчеркивают необходимость пересмотра подходов к валидации LLM для пользовательских приложений. Для разработчиков приложений с советами родителям важно не просто выбирать модель с высоким общим рейтингом, но и проводить детальный аудит по специфическим критериям, учитывающим культурный контекст и психологическую безопасность.

Источник: arXiv cs.AI ↗