Результаты бенчмарка DeepSWE v1.1
Команда Tura-AI представила результаты тестирования своего локального open-source агента на 20 задачах из набора DeepSWE v1.1. Тестирование проводилось с использованием модели GPT-5.6 SOL с высоким уровнем рассуждений (High reasoning effort). Ключевые метрики показывают существенное преимущество Tura перед официальным CLI-интерфейсом Codex:
| Метрика | Tura Balanced High | Tura Direct High | Codex CLI High |
|---|---|---|---|
| Успешность (Success Rate) | 80.0% | 65.0% | 60.0% |
| Экономия токенов | -49.6% | -83.5% | База (100%) |
| Снижение количества раундов | -66.8% | -84.0% | База (100%) |
Режим Balanced (сбалансированный) позволяет перераспределить сэкономленные токены на дополнительное исследование и верификацию, что привело к росту успешности на 20 пунктов по сравнению с Codex. Режим Direct максимизирует экономию ресурсов, снижая затраты на 83.5%, но с меньшей точностью (65%).
Архитектурное отличие: Макро-команды вместо циклов
Традиционные агенты тратят время и токены на повторяющиеся циклы «инспекция — ожидание — патч — ожидание — сборка». Tura внедряет концепцию macro tool — единую команду command_run, которая позволяет агенту строить дерево выполнения и запускать связанные действия за один вызов LLM.
Вместо 5 отдельных раундов (поиск через rg, применение патча, сборка cargo build, тесты, линтинг), Tura выполняет всю последовательность в одном структурированном макровызове. Это устраняет «разговорные накладные расходы» и сокращает количество раундов взаимодействия с моделью.
Обратное рассуждение (Backward Reasoning)
Основная проблема статистических моделей — склонность к генерации наиболее вероятного, а не оптимального кода. Tura использует стратегию обратного рассуждения: вместо движения от текущего состояния к цели ($s_1 \rightarrow s_n$), агент сначала оценивает предпоследнее состояние ($s_{n-1}$), а затем движется назад к исходному коду. Это помогает точнее выявлять корневые причины ошибок, особенно в сложных задачах, где стандартные подходы генерируют усредненные, неэффективные решения.
Управление контекстом как состояние среды выполнения
В отличие от других агентов, накапливающих «мусор» из старых навыков и историй сессий, Tura рассматривает контекст как часть машины состояний. Используются task_status и рекурсивные руководства по задачам, которые позволяют:
- Автоматически очищать контекст от устаревших данных.
- Сохранять точное состояние выполнения (коды ошибок, патчи) в
task_status.compact_context. - Избегать потери важных деталей при сжатии контекста (compaction).
Это решение снижает стоимость токенов на задачу и минимизирует риск того, что старый навык или размытое резюме помешают текущей работе.
Источник: Github ↗
