Исследования17 июля 2026 г., 06:17 МСК🤖 Auto

CANDI-QA: Тест на контекст для LLM в узких доменах

Исследователи представили CANDI-QA — новый бенчмарк, оценивающий способность LLM к контекстуальному выравниванию в специализированных областях, таких как медицина и финансы.

Баннер новости 3783

Проблема общих моделей в узких доменах

Развертывание больших языковых моделей (LLM) в критически важных сферах, таких как медицинская диагностика и финансовое консультирование, требует не просто знания фактов, а глубокого понимания контекста и осознанности пользователя. Традиционные бенчмарки часто не способны оценить эти нюансы, что приводит к ошибкам в высокорисковых сценариях. Для решения этой проблемы команда исследователей во главе с Megha Chakraborty представила CANDI-QA (Contextual Alignment for Niche Domains Question Answering).

Архитектура датасета: два типа задач

CANDI-QA состоит из экспертно курируемых пар «вопрос-ответ», разделенных на две ключевые категории, которые проверяют разные аспекты интеллекта модели:

  • Information Assistance Questions (IAQ): Прямые фактические запросы, требующие точного извлечения информации. Здесь проверяется способность модели не галлюцинировать при работе с фактами.
  • Applied Inference Questions (AIQ): Задачи многошагового рассуждения (multi-hop reasoning), требующие ситуативного вывода для генерации практических рекомендаций. Это проверка на способность модели «думать» в контексте конкретной ситуации пользователя.

Результаты тестирования: разрыв между моделями

Авторы протестировали более десяти разнообразных языковых моделей — от компактных open-source решений до передовых проприетарных систем. Результаты выявили серьезные ограничения текущих LLM в достижении контекстуального выравнивания без интеграции символических методов. В качестве базовой линии (baseline) исследователи представили MTSS-Net — легковесную нейро-символическую архитектуру, сочетающую нейронный поиск с правилами вывода, которая показала себя более надежной в узких доменах.

Категория вопросов Тип задачи Ключевое требование к модели
IAQ Прямой запрос Точное извлечение фактов, отсутствие галлюцинаций
AIQ Многошаговый вывод Ситуативная инференция, генерация actionable insights

Значение для индустрии

Исследование подчеркивает, что для создания надежного ИИ в высокорисковых областях недостаточно просто масштабировать параметры модели. Необходима интеграция контекстуальной осведомленности и, возможно, гибридных подходов, таких как предложенный MTSS-Net. CANDI-QA становится новым стандартом для оценки доверенности и точности LLM там, где цена ошибки максимальна.

Источник: arXiv cs.CL ↗