Первый шаг к доверию к арабским ИИ
Команда исследователей во главе с Аишей Алансари (Aisha Alansari) представила результаты HalluScoring 2026 — первого в мире совместного задания (shared task), посвященного обнаружению галлюцинаций и верификации ответов в арабском языке. Мероприятие проходило в условиях жесткой проверки обобщающей способности моделей: системы должны были работать с вопросами и ответами от LLM, которых они ранее не видели.
В исследовании использовались два специализированных датасета: HalluScore и HalluTruthQA. В задаче участвовали 13 команд, из которых 10 представили описания своих систем. Целью было не просто найти ложь, но и восстановить истинный факт.
Две задачи, четыре подзадачи
Соревнование было разделено на два основных направления, каждое из которых имело свои специфические ограничения:
- Задача 1 (Обнаружение): Бинарная классификация — является ли ответ галлюцинацией. Подзадача 1.1 тестировала обобщение на невидимые вопросы, а 1.2 — на ответы, сгенерированные невидимыми моделями.
- Задача 2 (Верификация): Расширенная задача, требующая не только детекции, но и выбора правильного ответа из шести кандидатов. Подзадача 2.1 касалась исламских знаний, а 2.2 — общих знаний.
Результаты: почему 0.77 — это мало
Результаты показали, что задача обнаружения галлюцинаций остается крайне сложной, особенно в условиях zero-shot или few-shot сценариев. Топовые системы набрали AUC-ROC (площадь под ROC-кривой) лишь около 0.77, что указывает на высокий уровень ложноположительных и ложноотрицательных срабатываний.
| Подзадача | Описание условия | Лучшая система | Метрика (AUC-ROC) |
|---|---|---|---|
| Subtask 1.1 | Обнаружение галлюцинаций на невидимых вопросах | REGLAT | 0.7717 |
| Subtask 1.2 | Обнаружение галлюцинаций от невидимых LLM | NAMAA | 0.7670 |
| Subtask 2.1 | Верификация (выбор ответа) в сфере исламских знаний | Топ-система (assisted) | 0.8824 |
| Subtask 2.2 | Верификация (выбор ответа) в общих знаниях | Топ-система (assisted) | 0.8565 |
Обратите внимание на разрыв в метриках: если просто обнаружить ложь (Задача 1) моделям дается тяжело (0.77), то при наличии помощи в выборе из нескольких вариантов (Задача 2) точность возрастает до 0.85–0.88. Это критически важно для разработчиков чат-ботов: простой детектор «да/нет» пока ненадежен, но система с механизмом выбора из кандидатов уже может быть полезна.
Значение для индустрии
Результаты HalluScoring 2026 подчеркивают «слепую зону» в развитии NLP: большинство исследований сосредоточено на английском языке. Арабский язык, с его морфологической сложностью и специфическими доменами (такими как религиозные тексты), требует отдельных подходов. Успешное решение этих задач откроет путь к созданию более надежных ассистентов для арабоязычного сегмента интернета, где доверие к информации является ключевым фактором.
Источник: arXiv cs.CL ↗
