Исследования24 августа 2026 г., 11:20 МСК🤖 Auto

Terminal Agents: как ИИ-агенты управляют терминалом

Новый обзор arXiv систематизирует работу AI-агентов в командных строках, выделяя 7 ключевых компетенций и проблематизируя текущие методы оценки.

Баннер новости 6371

От разрозненных исследований к единой парадигме

Команда исследователей во главе с И Бин (Yi Bin) из Университета Сингапура и других институтов опубликовала масштабный обзор "Terminal Agents" (arXiv:2608.20485). Авторы предлагают рассматривать AI-агентов не просто как инструменты для написания кода или использования софта, а как системы, где основной цикл «действие-наблюдение» происходит через выполнение команд в терминале, анализ текстового вывода и взаимодействие с состоянием среды.

Это определение позволяет объединить разрозненные исследования из областей software engineering, tool use и computer-use под одной методологической крышей, фокусируясь на том, как именно модель взаимодействует с операционной системой.

Семизвездочный профиль компетенций

Ключевой вклад работы — разработка seven-dimensional terminal competence profile (семизвездочного профиля компетенций). Авторы утверждают, что поведение агента формируется совместным влиянием модели, интерфейса, среды выполнения (harness/runtime) и самой операционной среды. Для структурирования этой сложности они выделяют следующие измерения:

Измерение Суть компетенции
Command Execution Способность корректно формировать и отправлять команды в терминал.
Textual Feedback Analysis Интерпретация stdout/stderr, ошибок и успешных ответов системы.
Stateful Interaction Удержание контекста и управление состоянием среды между шагами.
Verification Проверка того, что выполненное действие действительно достигло цели.
Recovery Способность исправлять ошибки и восстанавливать работу после сбоев.
Governance Соблюдение ограничений безопасности и этических норм при выполнении команд.
Process Quality Эффективность траектории решения задачи (минимизация лишних шагов).

Проблема оценки: результат vs процесс

Авторы критикуют текущее состояние бенчмарков, которые часто фокусируются только на финальном результате (успешно/неуспешно), игнорируя качество процесса. Обзор показывает, что:

  • Executable trajectories (исполняемые траектории) должны быть основой обучения, так как они связывают действия с их реальными последствиями.
  • Существующие оценки неравномерно покрывают аспекты восстановления (recovery) и управления (governance).
  • Сравнение систем часто зависит от конкретного бенчмарка, что делает невозможным прямое сравнение компонентов без учета условий среды.

Призыв к прозрачности и воспроизводимости

Исследование мотивирует сообщество перейти к явному reporting (отчетности) системных и runtime-условий. Авторы настаивают на использовании воспроизводимых трасс (replayable traces) и доказательств на уровне процесса, а не только финальных метрик. Это необходимо для того, чтобы понять, где именно кроются ограничения агентов: в модели, в интерфейсе или в среде выполнения.

Работа из 52 страниц и 7 рисунков становится фундаментальной базой для изучения терминального агентного поведения в разработке ПО и других прикладных доменах.

Источник: arXiv cs.AI ↗