Проблема доверия к самому себе
Основная сложность верификации автономных AI-агентов заключается в том, что их собственное состояние и отчеты часто ненадежны. Автор предлагает архитектуру, где верификация является структурной, а не постфактум. В этой системе детерминированный Executive владеет всеми убеждениями, а языковая модель (LLM) может только подавать типизированные предложения. Утверждение считается действительным только тогда, когда предсказание, зарегистрированное до действия, совпадает с наблюдением через код.
Механика самопроверки
Инструмент разработан так, чтобы быть «верификатором собственной науки». Каждый запуск автоматически аннулируется при нарушении строгих метрик: ошибок записи, размера рендера или соленых канареечных эхо-сигналов. Из первых восьми запусков архитектуры четыре были аннулированы, что позволило локализовать реальные дефекты. Кроме того, используется «теневая ссылка» (shadow reference), которая компилирует план, на который система была бы готова согласиться, даже если тестируемый механизм удален.
Ключевые метрики и результаты
Эксперименты показали четкий результат по одной переменной: отказ от цели (goal-abandonment) и ошибка привязки (binding error). Ниже представлены ключевые показатели эффективности:
| Метрика | Значение | Условия |
|---|---|---|
| Goal-abandonment (без механизма приверженности) | 1.00 | Абляция механизма приверженности |
| Goal-abandonment (с механизмом приверженности) | 0.00 | Нормальная работа |
| Binding error | 0.00 | Постоянно, независимо от абляции |
| Запусков на ARC-AGI-3 | 52 | Все запуски прошли валидацию |
| Успешных завершений задач | 0 | Предварительно зарегистрированный структурный дефект |
Выводы для индустрии
Исследование демонстрирует, что канал привязки (binding channel) не проявляется как дрейф по отдельным шагам, так как он контролируется кодом. Однако при его удалении происходит коллапс формирования гипотез на уровень выше. Важно отметить, что эффективность задач на наборе данных ARC-AGI-3 составила ноль, что было заранее задокументировано как структурный дефект. Главный вклад работы — методология верификации для разработки агентов, позволяющая измерять и разделять типы дрейфа.
Источник: arXiv cs.AI ↗
