Исследования2 октября 2026 г., 06:17 МСК🤖 Auto

HalluScoring 2026: Итоги первого теста на галлюцинации арабских LLM

Исследователи представили результаты HalluScoring 2026 — первого совместного задания по обнаружению галлюцинаций в арабском языке. Топовые модели показали AUC-ROC около 0.77, что подтверждает сложность задачи верификации фактов.

Баннер новости 8748

Первый шаг к доверию к арабским ИИ

Команда исследователей во главе с Аишей Алансари (Aisha Alansari) представила результаты HalluScoring 2026 — первого в мире совместного задания (shared task), посвященного обнаружению галлюцинаций и верификации ответов в арабском языке. Мероприятие проходило в условиях жесткой проверки обобщающей способности моделей: системы должны были работать с вопросами и ответами от LLM, которых они ранее не видели.

В исследовании использовались два специализированных датасета: HalluScore и HalluTruthQA. В задаче участвовали 13 команд, из которых 10 представили описания своих систем. Целью было не просто найти ложь, но и восстановить истинный факт.

Две задачи, четыре подзадачи

Соревнование было разделено на два основных направления, каждое из которых имело свои специфические ограничения:

  • Задача 1 (Обнаружение): Бинарная классификация — является ли ответ галлюцинацией. Подзадача 1.1 тестировала обобщение на невидимые вопросы, а 1.2 — на ответы, сгенерированные невидимыми моделями.
  • Задача 2 (Верификация): Расширенная задача, требующая не только детекции, но и выбора правильного ответа из шести кандидатов. Подзадача 2.1 касалась исламских знаний, а 2.2 — общих знаний.

Результаты: почему 0.77 — это мало

Результаты показали, что задача обнаружения галлюцинаций остается крайне сложной, особенно в условиях zero-shot или few-shot сценариев. Топовые системы набрали AUC-ROC (площадь под ROC-кривой) лишь около 0.77, что указывает на высокий уровень ложноположительных и ложноотрицательных срабатываний.

Подзадача Описание условия Лучшая система Метрика (AUC-ROC)
Subtask 1.1 Обнаружение галлюцинаций на невидимых вопросах REGLAT 0.7717
Subtask 1.2 Обнаружение галлюцинаций от невидимых LLM NAMAA 0.7670
Subtask 2.1 Верификация (выбор ответа) в сфере исламских знаний Топ-система (assisted) 0.8824
Subtask 2.2 Верификация (выбор ответа) в общих знаниях Топ-система (assisted) 0.8565

Обратите внимание на разрыв в метриках: если просто обнаружить ложь (Задача 1) моделям дается тяжело (0.77), то при наличии помощи в выборе из нескольких вариантов (Задача 2) точность возрастает до 0.85–0.88. Это критически важно для разработчиков чат-ботов: простой детектор «да/нет» пока ненадежен, но система с механизмом выбора из кандидатов уже может быть полезна.

Значение для индустрии

Результаты HalluScoring 2026 подчеркивают «слепую зону» в развитии NLP: большинство исследований сосредоточено на английском языке. Арабский язык, с его морфологической сложностью и специфическими доменами (такими как религиозные тексты), требует отдельных подходов. Успешное решение этих задач откроет путь к созданию более надежных ассистентов для арабоязычного сегмента интернета, где доверие к информации является ключевым фактором.

Источник: arXiv cs.CL ↗