Суть эксперимента: LALM против людей
Команда исследователей во главе с А. Сайядом провела эмпирическую оценку надежности Large Audio Language Models (LALM) в роли «судей» для полнодуплексных голосовых агентов. В качестве базовой модели (ground-truth) использовался Gemini 2.5 Flash, результаты которого сравнивались с оценками трех калиброванных человеческих респондентов. Тестирование охватило 209 стереосессий, включая 152 полных диалога (13 страт акцентов и условий) и 57 клипов с намеренно внесенными дефектами.
Ключевые метрики надежности
Исследование показало высокую корреляцию между оценками ИИ и людей. На 5 из 8 производственных измерений коэффициент корреляции Спирмена (LALM-человек) отклонялся от человеческого показателя (человек-человек) не более чем на 0.07. Кроме того, на 7 из 8 измерений 95% доверительные интервалы пересекаются. Модель согласуется со средним значением оценок трех людей в пределах 1 балла на 60–92% сессий.
Сравнение моделей Gemini
Разные версии семейств Gemini демонстрируют различную эффективность. Gemini 3.5 Flash улучшил простое согласие до 8 из 8 измерений, тогда как Gemini 3.1 Pro, несмотря на сопоставимую ранговую корреляцию, оценивал некоторые измерения значительно ниже людей. Это доказывает, что замена модели требует отдельной калибровки, а не просто переноса ранговых метрик.
| Модель | Простое согласие с людьми | Ранговая корреляция | Чувствительность к дефектам |
|---|---|---|---|
| Gemini 2.5 Flash | 60–92% (на 6 из 8 измерений) | Высокая (отклонение rho ≤ 0.07) | 45 из 48 ячеек: как люди или лучше |
| Gemini 3.5 Flash | Улучшено до 8 из 8 измерений | Информация недостаточна | Информация недостаточна |
| Gemini 3.1 Pro | Низкое согласие по ряду измерений | Сопоставима с 2.5 Flash | Информация недостаточна |
Экономический эффект и риски
Авторы оценивают, что человеческая оценка при текущем темпе тестирования обходится примерно в два порядка дороже (в 100 раз), чем эквивалентная нагрузка на LALM. Однако исследователи выделяют четыре области, требующие осторожности при развертывании. Данные предоставляют обоснованную базу для использования LALM в качестве замены или четвертого судьи, но только на тех измерениях, где статистическая значимость подтверждена.
Источник: arXiv cs.CL ↗
