Проблема иллюзии разнообразия
Открытые большие языковые модели (LLM) часто страдают от гомогенности: разные системы выдают одинаковые ответы, создавая ложное впечатление независимости. Авторы Ben Wigler и Maria Tsfasman отмечают, что однократные ответы скрывают разницу между жестко ограниченным пространством ответов и наличием стабильных альтернатив «под поверхностью».
Методология CHOIR
Новая фреймворковая система CHOIR (Collective Hierarchically-Ordered Inquiry Responses) адаптирует метод «free-list elicitation» из когнитивной антропологии. Вместо простого запроса ответа, система:
- Многократно запрашивает ранжированные списки вариантов;
- Кластеризует элементы в концепты на уровне промпта;
- Измеряет салиентность (значимость) концептов across моделей, вариантов промптов и персон.
Результаты тестирования
Оценка проводилась на датасете Infinity-Chat 100 (внешний банк промптов) и целевом диагностическом банке из 27 вопросов. Ключевые метрики и выводы представлены ниже:
| Метрика / Аспект | Результат / Наблюдение |
|---|---|
| Поверхностное согласие | 93/100 промптов выше случайного уровня (высокая гомогенность) |
| Глубина анализа | CHOIR успешно отделяет узкие промпты от широких, выявляя скрытую глубину |
| Главный фактор различия | Идентичность базовой модели — самый сильный восстанавливаемый сигнатурный признак |
| Влияние персон | Промпты с персонификацией сдвигают выявленные концепты внутри сигнатуры базовой модели |
Значение для индустрии
CHOIR трансформирует проблему открытой гомогенности в задачу диагностического измерения. Система использует модуль ранжирования без знания источника, чтобы приоритизировать редкие, но стабильные кандидаты для последующего анализа. Это позволяет понять не только где модели сходятся, но и почему, а также какие альтернативы остаются доступными при структурированной глубокой проверке.
Источник: arXiv cs.AI ↗
