Исследования22 июля 2026 г., 08:17 МСК🤖 Auto

SAAG: Как диагностировать галлюцинации агентов без утечки данных

Исследователи представили SAAG — каскадную систему оценки, которая разделяет вызовы функций на три этапа, позволяя точно находить ошибки и исправлять их без подглядывания в ответы.

Баннер новости 4107

Проблема бинарной оценки

Традиционные бенчмарки для оценки AI-агентов часто сводят успех к бинарной метрике: «вызвал функцию — правильно» или «нет». Это скрывает критические различия в ошибках. Модель может выбрать верную функцию, но выдать галлюцинированные аргументы, или соблюсти схему JSON, но выбрать агента по ложной причине. SAAG (Structured Agent Assessment and Grounding) предлагает декомпозировать этот процесс на три последовательных этапа диагностики.

Три уровня диагностики

Методология SAAG вводит строгую иерархию проверок, которая позволяет изолировать тип ошибки:

  • Registry Conformance: Проверка соответствия реестру. Выбрана ли вообще существующая функция из доступного списка?
  • Structural Completeness: Проверка полноты структуры. Заполнены ли все обязательные поля согласно схеме?
  • Argument Grounding: Проверка заземления аргументов. Соответствуют ли значения аргументов контексту и фактам?

Экспериментальные данные

Авторы протестировали фреймворк на локальных моделях с параметрами менее 4B, используя датасет Glaive. Тестирование проводилось на наборах с разным количеством агентов (5, 10 и 15). Результаты показали, что структурированная обратная связь значительно повышает точность аргументов и снижает уровень галлюцинаций значений по сравнению с однопроходным выводом.

Метрика / Параметр Результат / Описание
Размер моделей Локальные модели < 4B параметров
Датасет Glaive (function-calling)
Количество агентов 5, 10, 15 (контролируемые наборы)
Основной выигрыш Рост точности аргументов (Argument Precision)
Снижение ошибок Значительное уменьшение value hallucination
End-to-End F1 Умеренный рост, зависит от модели

Механизм самовосстановления

Ключевое преимущество SAAG — возможность итеративного self-repair. Когда модель ошибается, система предоставляет специфичный сигнал по конкретному этапу (например, «неверный аргумент»), что позволяет модели исправить ошибку, не «подглядывая» в ground-truth значения. Это делает процесс отладки агентов прозрачным и воспроизводимым.

Значение для индустрии

Работа, принятая на воркшоп KnowFM @ ACL 2026, подчеркивает, что для повышения надежности AI-агентов необходим переход от простых метрик точности к детальной диагностике. Разделение оценки на этапы необходимо для понимания того, где именно ломается цепочка принятия решений в разных семействах моделей.

Источник: arXiv cs.AI ↗