Проблема общих моделей в узких доменах
Развертывание больших языковых моделей (LLM) в критически важных сферах, таких как медицинская диагностика и финансовое консультирование, требует не просто знания фактов, а глубокого понимания контекста и осознанности пользователя. Традиционные бенчмарки часто не способны оценить эти нюансы, что приводит к ошибкам в высокорисковых сценариях. Для решения этой проблемы команда исследователей во главе с Megha Chakraborty представила CANDI-QA (Contextual Alignment for Niche Domains Question Answering).
Архитектура датасета: два типа задач
CANDI-QA состоит из экспертно курируемых пар «вопрос-ответ», разделенных на две ключевые категории, которые проверяют разные аспекты интеллекта модели:
- Information Assistance Questions (IAQ): Прямые фактические запросы, требующие точного извлечения информации. Здесь проверяется способность модели не галлюцинировать при работе с фактами.
- Applied Inference Questions (AIQ): Задачи многошагового рассуждения (multi-hop reasoning), требующие ситуативного вывода для генерации практических рекомендаций. Это проверка на способность модели «думать» в контексте конкретной ситуации пользователя.
Результаты тестирования: разрыв между моделями
Авторы протестировали более десяти разнообразных языковых моделей — от компактных open-source решений до передовых проприетарных систем. Результаты выявили серьезные ограничения текущих LLM в достижении контекстуального выравнивания без интеграции символических методов. В качестве базовой линии (baseline) исследователи представили MTSS-Net — легковесную нейро-символическую архитектуру, сочетающую нейронный поиск с правилами вывода, которая показала себя более надежной в узких доменах.
| Категория вопросов | Тип задачи | Ключевое требование к модели |
|---|---|---|
| IAQ | Прямой запрос | Точное извлечение фактов, отсутствие галлюцинаций |
| AIQ | Многошаговый вывод | Ситуативная инференция, генерация actionable insights |
Значение для индустрии
Исследование подчеркивает, что для создания надежного ИИ в высокорисковых областях недостаточно просто масштабировать параметры модели. Необходима интеграция контекстуальной осведомленности и, возможно, гибридных подходов, таких как предложенный MTSS-Net. CANDI-QA становится новым стандартом для оценки доверенности и точности LLM там, где цена ошибки максимальна.
Источник: arXiv cs.CL ↗
