Проблема домена SSH
Интеграция больших языковых моделей (LLM) в научные рабочие процессы сталкивается с серьезными методологическими и эпистемическими вызовами в области социальных и гуманитарных наук (SSH). Основные проблемы включают дисциплинарное разнообразие, необходимость многоязычного доступа к источникам и строгие требования к оценке результатов. Исследователи из проекта LLMs4EU и инфраструктуры ALT-EDIC предлагают решение, адаптирующее фундаментальные модели под практики SSH-исследователей.
Архитектура решения: Графы знаний + Корпуса
Ключевым элементом подхода является интеграция графов знаний (Knowledge Graphs) с многоязычными научными корпусами. Это позволяет модели не только генерировать текст, но и обеспечивать прослеживаемость (traceability) источников, что критически важно для академической достоверности. Система поддерживает задачи ответа на вопросы, сравнительного анализа документов и проведения литературных обзоров.
Методология оценки
Оценка эффективности модели проводится по протоколу LLMs4EU и включает два уровня:
- Количественный бенчмаркинг: тестирование на извлечении информации (retrieval), суммаризации, прослеживаемости ссылок и обнаружении галлюцинаций.
- Качественная оценка: экспертиза панели специалистов в области цифровых гуманитарных наук (Digital Humanities).
Результаты и значимость
Исследование демонстрирует, что доменно-чувствительные и регуляторно-осведомленные генеративные ИИ-системы могут поддерживать научную работу в SSH, сохраняя эпистемическую ответственность. Работа представлена на воркшопе LLMs4SSH конференции LREC 2026 (июль 2026 года) и описываетongoing use case (текущий кейс использования), что указывает на активную фазу внедрения и тестирования в реальных исследовательских средах.
Источник: arXiv cs.AI ↗
