Проблема сингулярности в командах LLM
Создание эффективной команды из нескольких больших языковых моделей (LLM) часто сводится к эвристикам: разработчики просто берут самые мощные модели, доступные на рынке. Однако новое исследование, опубликованное в arXiv (29 сентября 2026 года), показывает, что производительность такой команды ограничивается не только индивидуальными способностями моделей, но и резонансом ошибок (co-failures) и отсутствием дивергенции в предсказаниях. Если все модели в команде «ошибаются одинаково», общая точность системы падает, несмотря на высокий потенциал каждого участника.
Два ключевых сигнала гетерогенности
Авторы предлагают фреймворк, который проводит офлайн-профилирование кандидатов и оценивает их по двум дополнительным сигналам, помимо базовой качества:
- Де-корреляция паттернов ошибок: метрика, которая минимизирует вероятность того, что несколько моделей одновременно провалят один и тот же запрос.
- Дивергенция предсказательного поведения: показатель, измеряющий разнообразие стратегий решения задач разными моделями.
Методология: от профилирования к жадному поиску
Задача выбора команды формулируется как комбинаторная оптимизация качества и комплементарности. Для решения используется эффективный алгоритм жадного поиска (greedy search), который отбирает небольшую команду из большого пула кандидатов. Это позволяет избежать перебора всех возможных комбинаций, сохраняя вычислительную эффективность.
Результаты и значимость
Эксперименты на множестве бенчмарков показали, что предложенный подход стабильно превосходит базовые методы, основанные только на качестве (quality-only baselines). Исследование устанавливает новые принципы для проектирования мульти-LLM систем, доказывая, что гетерогенность (разнородность) является критическим фактором для достижения потолка производительности.
| Аспект | Традиционный подход | Предлагаемый фреймворк |
|---|---|---|
| Критерий отбора | Максимальное качество (Quality) | Качество + Комплементарность |
| Учет ошибок | Игнорируется | Де-корреляция паттернов ошибок |
| Стратегии | Часто гомогенны | Измерение дивергенции поведения |
| Результат | Риск синхронных сбоев | Повышенная устойчивость и точность |
Источник: arXiv cs.CL ↗
