Исследования11 июля 2026 г., 03:19 МСК🤖 Auto

Gemini как аудио-судья: Google доказал надежность LALM для оценки голосовых агентов

Исследование Google показало, что модели Gemini 2.5 Flash и 3.5 Flash могут заменять людей в оценке качества диалоговых голосовых агентов, экономя до двух порядков стоимости.

Баннер новости 3349

Суть эксперимента: LALM против людей

Команда исследователей во главе с А. Сайядом провела эмпирическую оценку надежности Large Audio Language Models (LALM) в роли «судей» для полнодуплексных голосовых агентов. В качестве базовой модели (ground-truth) использовался Gemini 2.5 Flash, результаты которого сравнивались с оценками трех калиброванных человеческих респондентов. Тестирование охватило 209 стереосессий, включая 152 полных диалога (13 страт акцентов и условий) и 57 клипов с намеренно внесенными дефектами.

Ключевые метрики надежности

Исследование показало высокую корреляцию между оценками ИИ и людей. На 5 из 8 производственных измерений коэффициент корреляции Спирмена (LALM-человек) отклонялся от человеческого показателя (человек-человек) не более чем на 0.07. Кроме того, на 7 из 8 измерений 95% доверительные интервалы пересекаются. Модель согласуется со средним значением оценок трех людей в пределах 1 балла на 60–92% сессий.

Сравнение моделей Gemini

Разные версии семейств Gemini демонстрируют различную эффективность. Gemini 3.5 Flash улучшил простое согласие до 8 из 8 измерений, тогда как Gemini 3.1 Pro, несмотря на сопоставимую ранговую корреляцию, оценивал некоторые измерения значительно ниже людей. Это доказывает, что замена модели требует отдельной калибровки, а не просто переноса ранговых метрик.

Модель Простое согласие с людьми Ранговая корреляция Чувствительность к дефектам
Gemini 2.5 Flash 60–92% (на 6 из 8 измерений) Высокая (отклонение rho ≤ 0.07) 45 из 48 ячеек: как люди или лучше
Gemini 3.5 Flash Улучшено до 8 из 8 измерений Информация недостаточна Информация недостаточна
Gemini 3.1 Pro Низкое согласие по ряду измерений Сопоставима с 2.5 Flash Информация недостаточна

Экономический эффект и риски

Авторы оценивают, что человеческая оценка при текущем темпе тестирования обходится примерно в два порядка дороже (в 100 раз), чем эквивалентная нагрузка на LALM. Однако исследователи выделяют четыре области, требующие осторожности при развертывании. Данные предоставляют обоснованную базу для использования LALM в качестве замены или четвертого судьи, но только на тех измерениях, где статистическая значимость подтверждена.

Источник: arXiv cs.CL ↗