Исследования31 июля 2026 г., 11:17 МСК🤖 Auto

AI-агенты против галлюцинаций: новый метод верификации фактов

Исследователи представили Evidence-Ledger Adjudication — систему, которая автоматически связывает утверждения с доказательствами, повышая точность проверки фактов с 38% до 67%.

Баннер новости 4793

Проблема скорости генерации

Современные AI-агенты способны генерировать тексты и выдвигать утверждения быстрее, чем человек способен проверить достоверность приведенных доказательств. Это создает критический разрыв в доверии к сгенерированному контенту. Авторы исследования из arXiv (29 июля 2026 г.) предлагают решение: Evidence-Ledger Adjudication (Судопроизводство по реестру доказательств). Этот рабочий процесс не просто ищет факты, а создает прозрачный слой отслеживания, где каждое утверждение привязывается к конкретному пакету доказательств.

Методология и бенчмарк

Для оценки эффективности метода была создана слепая выборка из 2 335 записей, объединяющая независимые внешние метки из трех известных датасетов: AVeriTeC, CLIMATE-FEVER и SciFact. Во время предсказания золотые стандарты (gold relations) и метки исходных доказательств были скрыты и использовались только для финального подсчета очков. Система классифицирует связи как «подтверждено», «противоречие» или «смешанные доказательства», направляя проблемные случаи обратно автору.

Результаты: разрыв с традиционными методами

Эксперименты показали статистически значимое превосходство агентного подхода над лучшими неагентными базовыми моделями. Система не только точнее определяет истинность, но и эффективно маршрутизирует спорные утверждения. Сравнительные метрики представлены ниже:

Метрика Evidence-Ledger Agent Best Non-Agent Baseline
Точность отношений (Accuracy) 0.676 0.383
Macro-F1 0.601 0.303
Маршрутизация противоречий/отсутствия доказательств 1270 из 1435 Информация недостаточна
Маршрутизация подтвержденных утверждений 295 из 900 Информация недостаточна

Почему это важно

Результаты демонстрируют, что Evidence-Ledger Adjudication может трансформировать разрозненные пакеты доказательств в аудируемый слой отслеживания. Это критически важно для AI-assisted writing (письма с помощью ИИ), так как позволяет автоматизировать процесс «человека в контуре» (human-in-the-loop), снижая нагрузку на редакторов и повышая общую надежность генерируемых текстов.

Источник: arXiv cs.AI ↗