Исследования3 сентября 2026 г., 11:19 МСК🤖 Auto

ClaimReceipt: Протокол верификации действий AI-агентов

Исследователи представили ClaimReceipt — систему, которая проверяет достаточность и полноту доказательств действий AI-агентов, обеспечивая прозрачность их решений.

Баннер новости 6665

Проблема доверия к AI-агентам

Оценка работы автономных AI-агентов сталкивается с двумя фундаментальными проблемами: достаточностью (можно ли воспроизвести утверждение на основе сохраненных данных) и полнотой (охватывает ли история все зафиксированные эксперименты). Стандартные логи и хешированные транзакции не дают надежных ответов на эти вопросы, что создает риски «черного ящика» в критически важных задачах.

Решение: ClaimReceipt

Авторы Peiying Zhu и Sidi Chang предлагают спецификацию ClaimReceipt, которая связывает типизированные доказательства транзакций с подписанным манифестом эксперимента. Система возвращает один из трех вердиктов для каждого утверждения: PASS (пройдено), INVALID (недействительно) или INCONCLUSIVE (неопределенно). Спецификация была заморожена до начала реализации (SHA-256: 18d109...b81), что гарантирует воспроизводимость.

Результаты тестирования

В ходе тестирования на исторических данных (1,392 записи) и проспективном эксперименте (CR-3) система продемонстрировала высокую точность. Ниже приведены ключевые метрики валидации:

Метрика / Тест Результат Значение
Воспроизведение аудитов CR-2 верификатор 100% совпадение с 5 ручными вердиктами
Репликация записей Детерминированные 600 записей
Репликация записей Пост-генерация 792 записи
Обнаружение семантических ошибок True Positives 11 из 11
Ложные срабатывания False Positives 0 из 8
Накладные расходы Время +0.021% к времени инференса
Накладные расходы Память 9.9 KB на транзакцию

Механизм работы и безопасность

В проспективном эксперименте CR-3 30 назначений фиксировались до начала инференса, а терминальные чеки подписывались и цепочечно связывались. Частные доказательства шифровались для аудитора. Система показала, что:

  • Полное предоставление доказательств дает вердикт PASS по покрытию и учету.
  • Сокрытие одного терминального чека возвращает INCONCLUSIVE_COVERAGE.
  • Сокрытие всех частных открытий сохраняет проверку протокола, но делает экономические утверждения неопределенными, что точно совпало с пререгистрированными прогнозами.

Ограничения и будущее

Исследователи отмечают, что спецификация ClaimReceipt пока не является однозначно понятной для независимых читателей (проба читаемости спецификации). Это указывает на то, что для надежной верификации требуется не только достаточное количество доказательств, но и четко определенный «коммитированный универсум», в котором любые упущения становятся видимыми. Работа представлена на воркшопе NeurIPS 2026 «Who Verifies the Agents?».

Источник: arXiv cs.AI ↗