Проблема: «Черный ящик» координации
В современных киберфизических системах человек, модуль принятия решений ИИ и автоматические контроллеры работают в едином контуре. Доверие к такой системе зависит от всей цепочки, а не от отдельной модели. Однако до сих пор не существовало стандарта, который позволял бы фиксировать временные метки и отслеживать, как ошибки (дрейф) и сбои распространяются между этими слоями. Без этого невозможно диагностировать, где именно происходит разрыв координации и как восстановить контроль.
Решение: TRACE на базе ALFRED
Команда во главе с Joshua Zuniga создала бенчмарк TRACE, сгенерировав 1918 «дрейфующих» трасс (traces). За основу взята база ALFRED — датасет для обучения ИИ выполнению бытовых задач по инструкциям. Исследователи искусственно внедрили контролируемый дрейф в данные, создав временные ряды из пяти уровней выполнения:
- Состояние (State)
- Наблюдение (Observation)
- Принятие решений (Decision)
- Правила (Rules)
- Управление (Control)
Каждая запись в трассе аннотирована: указан тип дрейфа, затронутый слой, время начала сбоя, ответственный субъект (человек или ИИ) и причинно-следственная связь. Валидация проводилась независимыми экспертами с высокой степенью согласия аннотаторов.
Метрики и честный протокол
Ключевой особенностью работы стал «leak-aware protocol» (протокол, учитывающий утечку данных). Авторы удалили из данных «почти идеальную» утечку времени начала сбоя, которая позволяла моделям угадывать ответ без анализа контента. На этом честном протоколе базовые модели показали следующие результаты (Macro-F1):
| Метрика | Результат | Значение |
|---|---|---|
| Локализация затронутого слоя | ~0.70 | Выше случайного и большинства базовых уровней |
| Идентификация ответственного субъекта | ~0.85 | Высокая точность определения: человек или ИИ |
| Определение причинно-следственной связи | ~0.49 | Сложная задача, но выше случайного выбора |
Вывод: Attention не всегда лучше
Исследование сравнило классические, рекуррентные и attention-based архитектуры. Парадоксальный вывод: на этом символическом бенчмарке тяжеловесные модели с механизмом внимания не превзошли более простые архитектуры. Это указывает на то, что для задачи диагностики дрейфа в многоуровневых системах важнее не емкость модели, а качество структурирования данных и протокол валидации.
Работа принята к публикации на конференции ICMLA 2026 и открывает путь к созданию более надежных систем, где человек и ИИ могут эффективно восстанавливать координацию после сбоев.
Источник: arXiv cs.AI ↗
