Проблема гетерогенных ансамблей
Использование ансамблей из разных языковых моделей (LLM) расширяет пространство возможных ответов, но создает критическую проблему: отсутствует четкий критерий, когда новый сгенерированный ответ должен заменить уже поддерживаемый. Традиционные методы часто полагаются на доверие к «консенсусу» без строгой проверки эквивалентности, что приводит к ошибкам при синтезе.
Метод Agreement-Before-Diversity (ABD)
Авторы предлагают метод ABD — замороженное, не требующее разметки правило принятия решений. Суть подхода заключается в разделении потенциала кандидатов и права на замену. Якорный ответ сохраняется только в том случае, если два дополнительных доверенных образца подтверждают его в рамках фиксированного отношения эквивалентности. В противном случае происходит замена на гетерогенный синтез. Этот механизм позволяет сделать процесс верификации явным и аудируемым.
Математическое обоснование
Исследование доказывает две точные тождественности для механизма гейтирования:
- Разница в точности относительно безусловного синтеза определяется совместно покрытием согласия и преимуществом якоря на защищенном подмножестве.
- Разница относительно полного отказа от синтеза отражает контраст между авторизованным восстановлением и авторизованным разрушением.
Метод не предполагает независимости или калиброванной уверенности моделей. Ожидаемые вычислительные затраты составляют приблизительно $8 - 5 \times \text{coverage}$ вызовов.
Результаты бенчмарков
Метод ABD демонстрирует значительное превосходство над контрольными группами (Single9 и HAC) на строгих тестах. Результаты приведены в таблице ниже:
| Бенчмарк | Метод ABD | Single9 | HAC | Размер выборки (n) |
|---|---|---|---|---|
| LiveCodeBench-v6 (полный) | 59.43% | 52.57% | 52.00% | 175 |
| GPQA-Diamond (нетронутый сплит) | 75.00% | 72.78% | 72.78% | 180 |
Локализация ошибок
Особое внимание уделено анализу расхождений. На LiveCodeBench-v6 в 3 защищенных случаях расхождений не произошло, что подтверждает теоретическую оценку вклада гейта в 1.71 балла. На GPQA-Diamond наблюдается 13 случаев расхождений против 8, а при замороженной пертурбации якоря — 12 против 0. Это доказывает, что разнообразие поставляет потенциал, а структура верификации — авторитет.
Источник: arXiv cs.AI ↗
