Суть проблемы: накопление ошибок в длинных цепочках
Исследователи из Microsoft Research (Philippe Laban, Tobias Schnabel, Jennifer Neville) провели стресс-тест под названием DELEGATE-52. Цель работы — оценить надежность AI-систем в сценариях «делегированной работы», где пользователь поручает модели выполнить многошаговые изменения важных артефактов (документы, код, таблицы) с минимальным человеческим контролем на каждом этапе.
Методология использует цепочки задач «трансформация-инверсия». Это позволяет точно измерить, сохраняется ли исходный смысл данных после серии правок. Важно отметить: исследование фокусируется исключительно на семантической целостности, а не на скорости выполнения или удобстве для пользователя.
Ключевые цифры и результаты
Результаты выявили критическую уязвимость современных моделей при длительном взаимодействии. Ошибки носят точечный характер, но накапливаются экспоненциально. Ниже приведены данные по деградации целостности артефактов после 20 итераций делегирования:
| Тип задачи / Домен | Деградация целостности (после 20 итераций) | Характеристика устойчивости |
|---|---|---|
| Текстовые документы и общие задачи | 19–34% | Высокая чувствительность к накоплению семантических искажений |
| Python-скрипты и код | < 1% | Максимальная робастность благодаря строгой структуре языка |
Почему это важно для индустрии
Исследование не отрицает полезность AI, но указывает на разрыв между высокими баллами в стандартных бенчмарках и реальной надежностью в длинных рабочих процессах. Текущие продакшн-системы могут компенсировать эти недостатки за счет:
- Верификационных циклов: автоматической проверки результатов на каждом шаге.
- Оркестрации: использования специализированных агентов и слоев управления.
- Доменной специфики: как видно из данных по Python, структурированные данные обрабатываются значительно надежнее.
Авторы подчеркивают, что DELEGATE-52 — это диагностический инструмент, а не приговор. Проблема «коррупции документов» при делегировании остается открытым вызовом для инженерии и обучения моделей, ориентированных на долгосрочную память и контекст.
Источник: Microsoft Research ↗
