Исследования5 сентября 2026 г., 05:19 МСК🤖 Auto

Conformal Relevance: новый подход к точности LLM без ручного промптинга

Исследователи представили фреймворк Conformal Relevance, объединяющий конформное предсказание и ин-контекстное обучение для автоматического контроля качества ответов LLM.

Баннер новости 6828

Команда исследователей во главе с Сяо Ши Хуангом (Xiao Shi Huang) представила метод Conformal Relevance, опубликованный в материалах EMNLP 2026. Решение решает фундаментальную проблему NLP-задач, таких как суммаризация и извлекаемый вопросно-ответный поиск (extractive QA): как гарантировать полноту ответа (coverage), не жертвуя его лаконичностью (conciseness).

Проблема ручного инжиниринга

Традиционные методы конформного предсказания требуют создания специфических функций оценки (scoring functions). Наилучшие результаты достигались за счет ручного написания промптов, где модель оценивала важность контента. Этот процесс трудоемок, требует глубокой экспертизы и не масштабируется на новые задачи.

Решение: In-Context Ensembles

Авторы предлагают автоматизировать создание функции оценки через ин-контекстное обучение (in-context learning) и ансамблирование. Фреймворк сам отбирает примеры для контекста и комбинирует оценки, что позволяет поддерживать статистические гарантии покрытия при минимальном вмешательстве человека.

Результаты на 7 задачах

Эксперименты показали, что Conformal Relevance превосходит ручные промпты по соотношению «точность/лаконичность». Ниже приведена сравнительная оценка эффективности подхода:

Метрика Ручной промптинг (SOTA) Conformal Relevance (In-Context) Преимущество
Гарантия покрытия (Coverage) Высокая (при ручной настройке) Высокая (автоматическая) Сохранение гарантий
Лаконичность (Conciseness) Средняя/Низкая Высокая Улучшение за счет ансамбля
Затраты на разработку Высокие (ручной труд) Минимальные Автоматизация

Теоретический вклад

Помимо эмпирических результатов, авторы предоставили теоретическое обоснование. Они вывели условие комплементарности, определяющее, когда ансамблирование улучшает наихудшие оценки, и границу насыщения (saturation bound), описывающую предел улучшения качества при увеличении разнообразия ансамбля.

Код фреймворка доступен для воспроизведения результатов, что открывает путь к более надежным и экономичным LLM-приложениям в критически важных сферах.

Источник: arXiv cs.CL ↗