Проблема доверия к AI-агентам
Оценка работы автономных AI-агентов сталкивается с двумя фундаментальными проблемами: достаточностью (можно ли воспроизвести утверждение на основе сохраненных данных) и полнотой (охватывает ли история все зафиксированные эксперименты). Стандартные логи и хешированные транзакции не дают надежных ответов на эти вопросы, что создает риски «черного ящика» в критически важных задачах.
Решение: ClaimReceipt
Авторы Peiying Zhu и Sidi Chang предлагают спецификацию ClaimReceipt, которая связывает типизированные доказательства транзакций с подписанным манифестом эксперимента. Система возвращает один из трех вердиктов для каждого утверждения: PASS (пройдено), INVALID (недействительно) или INCONCLUSIVE (неопределенно). Спецификация была заморожена до начала реализации (SHA-256: 18d109...b81), что гарантирует воспроизводимость.
Результаты тестирования
В ходе тестирования на исторических данных (1,392 записи) и проспективном эксперименте (CR-3) система продемонстрировала высокую точность. Ниже приведены ключевые метрики валидации:
| Метрика / Тест | Результат | Значение |
|---|---|---|
| Воспроизведение аудитов | CR-2 верификатор | 100% совпадение с 5 ручными вердиктами |
| Репликация записей | Детерминированные | 600 записей |
| Репликация записей | Пост-генерация | 792 записи |
| Обнаружение семантических ошибок | True Positives | 11 из 11 |
| Ложные срабатывания | False Positives | 0 из 8 |
| Накладные расходы | Время | +0.021% к времени инференса |
| Накладные расходы | Память | 9.9 KB на транзакцию |
Механизм работы и безопасность
В проспективном эксперименте CR-3 30 назначений фиксировались до начала инференса, а терминальные чеки подписывались и цепочечно связывались. Частные доказательства шифровались для аудитора. Система показала, что:
- Полное предоставление доказательств дает вердикт PASS по покрытию и учету.
- Сокрытие одного терминального чека возвращает INCONCLUSIVE_COVERAGE.
- Сокрытие всех частных открытий сохраняет проверку протокола, но делает экономические утверждения неопределенными, что точно совпало с пререгистрированными прогнозами.
Ограничения и будущее
Исследователи отмечают, что спецификация ClaimReceipt пока не является однозначно понятной для независимых читателей (проба читаемости спецификации). Это указывает на то, что для надежной верификации требуется не только достаточное количество доказательств, но и четко определенный «коммитированный универсум», в котором любые упущения становятся видимыми. Работа представлена на воркшопе NeurIPS 2026 «Who Verifies the Agents?».
Источник: arXiv cs.AI ↗
