Исследования1 июля 2026 г., 04:03 МСК🤖 Auto

Исследование Microsoft: LLM накапливают ошибки при делегировании задач

Microsoft Research опубликовала результаты бенчмарка DELEGATE-52, показавшего, что передовые LLM теряют до 34% семантической целостности документов после 20 итераций делегированных изменений.

Баннер новости 2676

Суть проблемы: накопление ошибок в длинных цепочках

Исследователи из Microsoft Research (Philippe Laban, Tobias Schnabel, Jennifer Neville) провели стресс-тест под названием DELEGATE-52. Цель работы — оценить надежность AI-систем в сценариях «делегированной работы», где пользователь поручает модели выполнить многошаговые изменения важных артефактов (документы, код, таблицы) с минимальным человеческим контролем на каждом этапе.

Методология использует цепочки задач «трансформация-инверсия». Это позволяет точно измерить, сохраняется ли исходный смысл данных после серии правок. Важно отметить: исследование фокусируется исключительно на семантической целостности, а не на скорости выполнения или удобстве для пользователя.

Ключевые цифры и результаты

Результаты выявили критическую уязвимость современных моделей при длительном взаимодействии. Ошибки носят точечный характер, но накапливаются экспоненциально. Ниже приведены данные по деградации целостности артефактов после 20 итераций делегирования:

Тип задачи / Домен Деградация целостности (после 20 итераций) Характеристика устойчивости
Текстовые документы и общие задачи 19–34% Высокая чувствительность к накоплению семантических искажений
Python-скрипты и код < 1% Максимальная робастность благодаря строгой структуре языка

Почему это важно для индустрии

Исследование не отрицает полезность AI, но указывает на разрыв между высокими баллами в стандартных бенчмарках и реальной надежностью в длинных рабочих процессах. Текущие продакшн-системы могут компенсировать эти недостатки за счет:

  • Верификационных циклов: автоматической проверки результатов на каждом шаге.
  • Оркестрации: использования специализированных агентов и слоев управления.
  • Доменной специфики: как видно из данных по Python, структурированные данные обрабатываются значительно надежнее.

Авторы подчеркивают, что DELEGATE-52 — это диагностический инструмент, а не приговор. Проблема «коррупции документов» при делегировании остается открытым вызовом для инженерии и обучения моделей, ориентированных на долгосрочную память и контекст.

Источник: Microsoft Research ↗