В мире искусственного интеллекта, где границы между генеративными моделями и автономными агентами становятся всё более размытыми, инфраструктура, поддерживающая эти системы, часто остается в тени. Мы привыкли обсуждать параметры моделей, архитектуры трансформеров и методы обучения с подкреплением (RL), но редко задумываемся о том, где именно «живут» эти агенты, когда они действуют. Для современных AI-агентов среда выполнения — это не просто контейнер с Docker, а полноценная операционная система с файловой системой, сетевым стеком и живыми процессами. Именно эта сложность создает узкое горлышко в масштабировании агентов.
Команда Kimi AI от Moonshot AI совместно с kvcache-ai решила эту проблему, опубликовав под лицензией MIT проект AgentENV (AENV). Это не просто еще один инструмент для оркестрации, а фундаментальная переработка подхода к изоляции сред для агентов. Платформа использует микровиртуальные машины Firecracker, чтобы обеспечить безопасность уровня ядра Linux, при этом сохраняя скорость запуска, недостижимую для традиционных виртуальных машин. AgentENV уже доказал свою эффективность в обучении модели Kimi K3, и теперь этот опыт доступен всему сообществу.
01Почему контейнеры Docker не подходят для агентов
Чтобы понять революционность AgentENV, нужно сначала осознать проблему, которую он решает. Традиционный подход к изоляции в индустрии ИИ опирается на контейнеры Docker. Они запускаются мгновенно, потребляют мало ресурсов и легко масштабируются. Однако у контейнеров есть критический недостаток для агентов: они разделяют ядро хост-системы. Если AI-агент генерирует код, который содержит уязвимости или пытается выполнить вредоносные действия, он может потенциально воздействовать на другие контейнеры или даже на хост-машину. В контексте агентов, которые могут взаимодействовать с внешними системами, это неприемлемый риск.
С другой стороны, полноценные виртуальные машины (VM) обеспечивают полную изоляцию, так как имеют собственное ядро. Но они слишком тяжелы. Запуск VM занимает заметное время, а в памяти они удерживают значительные объемы данных даже в простое. Для агентов, которым нужно выполнять тысячи коротких «роллов» (циклов взаимодействия с окружением) в секунду, такая задержка делает обучение с подкреплением экономически нецелесообразным. AgentENV нацелен именно на этот разрыв, предлагая лучшее из двух миров: изоляцию VM и скорость контейнеров.

02Архитектура на базе Firecracker: безопасность уровня ядра
В основе AgentENV лежит технология Firecracker, разработанная Amazon Web Services. Каждая среда выполнения агента (sandbox) представляет собой микровиртуальную машину Firecracker. Это означает, что у каждого агента есть свое собственное изолированное ядро Linux, собственная файловая система и сетевой стек. Запросы от клиента поступают через HTTP API на базе фреймворка Axum, который затем перенаправляется оркестратору, управляющему жизненным циклом песочницы.
Внутри каждой гостевой системы работает демон envd, который обрабатывает выполнение команд, файловые операции и отправляет отчеты о состоянии на порт 49983. Обратный прокси маршрутизирует HTTP и WebSocket трафик от клиентов к сервисам, работающим внутри VM. Такая архитектура гарантирует, что даже если агент «сломается» или будет скомпрометирован, его воздействие ограничено пределами одной микровиртуальной машины.
03Умное управление хранилищем: overlaybd и ublk
Одной из самых сложных задач при масштабировании виртуальных машин является управление дисковым пространством. Дублирование образов операционной системы для каждой песочницы привело бы к колоссальному расходу места. AgentENV решает эту проблему через инновационный подход к хранению данных. Корневая файловая система (rootfs) обслуживается через пользовательское блочное устройство ublk, которое опирается на слои образов overlaybd.

Эта архитектура позволяет разделять общие для всех песочниц неизменяемые базовые слои. Каждая песочница записывает свои изменения в собственный верхний слой. Это означает, что если вы запускаете множество агентов с одинаковой базовой ОС, на диске хранится только один образ ОС и слои изменений. Такой подход радикально снижает требования к дисковому пространству и ускоряет инициализацию новых сред.
04Магия снапшотов: клонирование за миллисекунды
Главная особенность AgentENV, делающая его незаменимым для обучения с подкреплением (RL), — это система снапшотов. В традиционных системах создание снимка состояния требует записи полного образа диска, что занимает время. AgentENV использует инкрементальные снапшоты, фиксируя только изменения в памяти и файловой системе.
Результаты впечатляют: среды, основанные на снапшотах, загружаются или возобновляются менее чем за 50 миллисекунд, а пауза занимает менее 100 миллисекунд. Даже при интенсивной записи на диск захват инкрементального снапшота завершается менее чем за 100 мс. Это позволяет агентам «замораживать» свое состояние, делить его и продолжать работу с разных точек без потери производительности.
05Функция Fork: ветвление состояний для RL
Для обучения с подкреплением ключевой особенностью является возможность ветвления. Запущенная песочница может клонироваться в несколько независимых дочерних песочниц на том же узле. Источник временно приостанавливается во время захвата, а затем возобновляет работу. Каждый дочерний элемент наследует файловую систему, память и конфигурацию ресурсов источника. Это позволяет дорогостоящие настройки выполнить один раз, а затем разветвить состояние на параллельные запуски. Снапшоты могут сохраняться в объектное хранилище, совместимое с S3, или в общую распределенную файловую систему.
Источник: MarkTechPost ↗
