Исследования5 августа 2026 г., 04:17 МСК🤖 Auto

16 моделей, 1,69 голоса: почему ансамбли LLM не дают единого мнения

Исследование показывает, что усреднение ответов 16 моделей из 10 семейств дает лишь 1,69 уникальных формулировок. Разброс мнений зависит не от сложности задачи, а от конкретного состава ансамбля.

Баннер новости 5094

Суть эксперимента: когда «коллективный разум» не работает

Команда исследователей во главе с Марио Вега-Барбасом провела preregistered-эксперимент, чтобы измерить дисперсию (разброс) ответов больших языковых моделей. В отличие от стандартных бенчмарков, где есть правильный ответ, задача была сформулирована так, что единоверного решения не существует — анализ психотерапевтических случаев.

Участниками стали 16 моделей, принадлежащих к 10 различным семействам. Для анализа было сгенерировано 7 082 формулировки на основе 15 стратифицированных клинических vignettes (сценариев). Ключевой метрикой выступил Vendi Score — показатель, вычисляемый как экспонента энтропии фон Неймана матрицы сходства, который интерпретируется как «эффективное число уникальных элементов».

Цифры и результаты

Результаты показали, что ансамблевый подход не гарантирует разнообразия. Средний показатель семантической диверсификации составил всего 1,69 уникальных формулировок. Для сравнения: базовая линия (одна модель, запущенная многократно) дала 1,43. Разница есть, но она минимальна, что ставит под сомнение эффективность простых ансамблей для задач, требующих креативности или множественных интерпретаций.

Метрика / Параметр Значение Комментарий
Количество моделей в ансамбле 16 Из 10 разных семейств
Количество сценариев (vignettes) 15 Стратифицированные клинические случаи
Всего сгенерированных формулировок 7 082 Объем выборки для анализа
Средний Vendi Score (ансамбль) 1.69 Эффективное число уникальных мнений
Средний Vendi Score (базовая линия) 1.43 Результат многократных запусков одной модели

Почему модели «молчат» хором?

Исследователи ввели понятие per-model dissent contribution (вклад каждого модели в несогласие). Это величина, дополняющая среднее сходство модели с остальными участниками ансамбля. Анализ показал, что идентичность модели действительно структурирует разногласия, но предсказать это сложно:

  • Семейная принадлежность не гарантирует сходства: модели из одного семейства группировались вместе лишь в 5 случаях из парных сравнений.
  • Контент важнее сложности: разброс ответов не коррелировал с «открытостью интерпретации» сценария, а зависел от клинического содержания.
  • Эффект состава ансамбля: самый «непокорный» голос менялся в зависимости от того, с кем он соревнуется. Аутсайдер описывает состояние ансамбля, а не свойства конкретной модели.

Вывод для индустрии

Статья доказывает, что дисперсия, создаваемая ансамблем, — это свойство, которое нужно измерять, а не предполагать. Простое усреднение ответов 16 моделей не дает «множества перспектив» в ожидаемой мере. Для задач, где нет единственно верного ответа, важно понимать, что «голос» ансамбля часто является артефактом конкретного состава участников, а не результатом глубокого анализа.

Источник: arXiv cs.CL ↗