Суть эксперимента: когда «коллективный разум» не работает
Команда исследователей во главе с Марио Вега-Барбасом провела preregistered-эксперимент, чтобы измерить дисперсию (разброс) ответов больших языковых моделей. В отличие от стандартных бенчмарков, где есть правильный ответ, задача была сформулирована так, что единоверного решения не существует — анализ психотерапевтических случаев.
Участниками стали 16 моделей, принадлежащих к 10 различным семействам. Для анализа было сгенерировано 7 082 формулировки на основе 15 стратифицированных клинических vignettes (сценариев). Ключевой метрикой выступил Vendi Score — показатель, вычисляемый как экспонента энтропии фон Неймана матрицы сходства, который интерпретируется как «эффективное число уникальных элементов».
Цифры и результаты
Результаты показали, что ансамблевый подход не гарантирует разнообразия. Средний показатель семантической диверсификации составил всего 1,69 уникальных формулировок. Для сравнения: базовая линия (одна модель, запущенная многократно) дала 1,43. Разница есть, но она минимальна, что ставит под сомнение эффективность простых ансамблей для задач, требующих креативности или множественных интерпретаций.
| Метрика / Параметр | Значение | Комментарий |
|---|---|---|
| Количество моделей в ансамбле | 16 | Из 10 разных семейств |
| Количество сценариев (vignettes) | 15 | Стратифицированные клинические случаи |
| Всего сгенерированных формулировок | 7 082 | Объем выборки для анализа |
| Средний Vendi Score (ансамбль) | 1.69 | Эффективное число уникальных мнений |
| Средний Vendi Score (базовая линия) | 1.43 | Результат многократных запусков одной модели |
Почему модели «молчат» хором?
Исследователи ввели понятие per-model dissent contribution (вклад каждого модели в несогласие). Это величина, дополняющая среднее сходство модели с остальными участниками ансамбля. Анализ показал, что идентичность модели действительно структурирует разногласия, но предсказать это сложно:
- Семейная принадлежность не гарантирует сходства: модели из одного семейства группировались вместе лишь в 5 случаях из парных сравнений.
- Контент важнее сложности: разброс ответов не коррелировал с «открытостью интерпретации» сценария, а зависел от клинического содержания.
- Эффект состава ансамбля: самый «непокорный» голос менялся в зависимости от того, с кем он соревнуется. Аутсайдер описывает состояние ансамбля, а не свойства конкретной модели.
Вывод для индустрии
Статья доказывает, что дисперсия, создаваемая ансамблем, — это свойство, которое нужно измерять, а не предполагать. Простое усреднение ответов 16 моделей не дает «множества перспектив» в ожидаемой мере. Для задач, где нет единственно верного ответа, важно понимать, что «голос» ансамбля часто является артефактом конкретного состава участников, а не результатом глубокого анализа.
Источник: arXiv cs.CL ↗
