Исследования24 сентября 2026 г., 08:17 МСК🤖 Auto

TwinCheck: Как верификация «от противного» подняла успех GPT-5.6 с 45% до 58%

Исследователи представили метод TwinCheck, который использует контрфактические сценарии для проверки действий агентов. Тестирование на GPT-5.6 показало значительный рост успешности выполнения задач без регрессии.

Баннер новости 8161

Проблема локальных ошибок в цепочках агентов

В сложных многошаговых сценариях (stateful tool agents) одна локально правдоподобная, но ошибочная команда (tool call) может разрушить весь успешный траекторию выполнения. Традиционные методы верификации часто сталкиваются с дилеммой: подозрение в ошибке не всегда оправдывает вмешательство, так как замена действия сама по себе может стать источником нового сбоя. Авторы работы Jiaxuan Dai и Tianyi Huang предлагают решение, которое рассматривает вмешательство только при наличии конкретных доказательств локальной гипотезы отказа.

Механика TwinCheck: создание «отрицательного близнеца»

Метод TwinCheck — это политика верификации на этапе инференса (inference-time verification). Алгоритм работает по следующему принципу:

  • Генерация контрфакта: Система создает альтернативный сценарий — «отрицательного близнеца» (negative twin), основанный на текущем состоянии трассы выполнения.
  • Структурная проверка: Альтернативное действие проходит строгие структурные проверки.
  • Парная верификация: Специальный верификатор сравнивает оригинальное предложение агента и его «близнеца» в обоих порядках. Замена происходит только если «близнец» явно предпочтительнее в обеих конфигурациях.

Ключевая особенность подхода — точная репликация (exact replay). При парном сравнении ответы и действия агента фиксируются до момента первого принятого вмешательства, что позволяет изолировать эффект от замены от эффекта случайного ресемплинга.

Результаты тестирования на BFCL V4

Основной анализ проводился на наборе данных BFCL V4 (BigCodeBench Large), включающем 159 многошаговых задач с полными парами точной репликации. Метрика успеха задачи (task success) для модели GPT-5.6 Sol демонстрирует существенный прирост благодаря внедрению TwinCheck.

Метрика Без TwinCheck С TwinCheck Изменение
Успешность задач (GPT-5.6 Sol) 45.3% 58.5% +13.2 п.п.
95% доверительный интервал (bootstrap) [8.2, 18.8] Статистически значимо
Регрессия (успех → провал) 0 случаев Нулевая регрессия

Почему это важно для индустрии

Результаты переосмысливают подход к ремонту на границе выполнения (execution-boundary repair). Вместо того чтобы полагаться на общую надежность модели, TwinCheck делает объектом верификации само контрфактическое действие. Отсутствие случаев регрессии (когда исправление приводило к провалу там, где была успех) критически важно для внедрения таких систем в продакшен, где цена ошибки высока. Метод позволяет безопасно повышать надежность агентов, работающих с внешними инструментами, без риска дестабилизации уже работающих сценариев.

Источник: arXiv cs.AI ↗