Исследования2 октября 2026 г., 01:18 МСК🤖 Auto

TomasuLLM: Асинхронное выполнение инструментов для ускорения AI-агентов

Исследователи представили TomasuLLM — рантайм, использующий спекулятивное выполнение вне порядка для сокращения простоев LLM-агентов при работе с долгими инструментами.

Баннер новости 8733

Проблема: простои агентов

В современных LLM-агентах, особенно в задачах программирования, значительная часть времени тратится на ожидание завершения внешних инструментов: компиляторов, тестовых наборов и системных команд. Эти операции могут занимать от секунд до минут, в то время как модель простаивает. Исследователи из команды, опубликовавшей работу в arXiv (22 сентября 2026 года), применили к этой проблеме подход, известный в архитектуре процессоров как out-of-order execution (выполнение вне порядка).

Решение: TomasuLLM

TomasuLLM — это рантайм, который позволяет агенту планировать будущие действия и запускать их заранее, не дожидаясь завершения предыдущих шагов. Ключевые механизмы системы:

  • Изоляция: Спекулятивные действия запускаются в изолированных песочницах с копированием при записи (copy-on-write), что предотвращает побочные эффекты.
  • Отслеживание зависимостей: Система отслеживает зависимости и эффекты каждого действия.
  • Порядок фиксации: Результаты применяются к основному состоянию только в правильном порядке траектории, после валидации против зафиксированного состояния.

Результаты бенчмарков

Методика показала значительное ускорение на трех различных наборах данных, охватывающих задачи от субсекундных до многоминутных. Важно отметить, что система не допускает ложных срабатываний: среди 4 010 проверенных записей валидации коммитов было зафиксировано 0 false accepts.

Бенчмарк Количество задач/сессий Ускорение (Speedup)
SWE-bench Verified 100 задач 1.31x
Terminal-Bench 2.0 28 задач 1.35x
SWE-Marathon 18 сессий 1.27x (matched progress)

Значение для индустрии

Работа демонстрирует, что архитектурные паттерны из области операционных систем и компьютерной архитектуры могут быть эффективно адаптированы для оптимизации LLM-агентов. Это особенно критично для сложных задач разработки ПО (SWE), где задержка ответа агента напрямую влияет на продуктивность разработчиков.

Источник: arXiv cs.CL ↗