Релиз модели28 июля 2026 г., 01:17 МСК🤖 Auto

Kimi AI и kvcache-ai открыли AgentENV: движок для RL-обучения K3

Команды Moonshot AI и kvcache-ai опубликовали под лицензией MIT платформу AgentENV. Это распределенная система на базе Firecracker, обеспечивающая изоляцию и скорость для обучения агентов с подкреплением (Agentic RL) модели Kimi K3.

Баннер новости 4498

Решение проблемы изоляции в Agentic RL

Обучение агентов с подкреплением (Agentic RL) требует не просто генерации текста, а выполнения кода в реальной среде. Традиционные контейнеры (Docker) делят ядро хоста, что снижает безопасность при выполнении сгенерированного моделью кода, а полноценные виртуальные машины (VM) слишком тяжелы для масштабирования. AgentENV закрывает этот разрыв, используя микро-ВМ Firecracker с собственным ядром Linux, файловой системой и сетевым стеком для каждого агента.

Архитектура и производительность

Система построена на API Axum и использует технологию overlaybd через ublk для хранения. Это позволяет разделять read-only базовые слои между песочницами, а изменения записывать в верхние слои. Ключевые метрики производительности, заявленные разработчиками:

Операция Время выполнения Примечание
Запуск/Восстановление из снапшота < 50 мс Мгновенное развертывание среды
Пауза (Pause) < 100 мс Сохранение состояния без удаления
Инкрементальный снимок < 100 мс Даже при активной записи на диск
Форкинг (Fork) До 16 дочерних сред Клонирование работающей песочницы на одном узле

Механизмы масштабирования

Для эффективного обучения Kimi K3 (модель с 2.8 триллионами параметров MoE) критически важна плотность. AgentENV использует memory ballooning для возврата неиспользуемой памяти гостя хосту, что позволяет поддерживать оверкоммит. Снапшоты хранятся в S3-совместимом хранилище или распределенной ФС, а локальный диск работает как кэш для overlaybd, что позволяет загружать образы по требованию без предварительного прогрева.

Совместимость с E2B и развертывание

AgentENV предлагает E2B-compatible HTTP API. Это означает, что существующие проекты на базе Python или TypeScript SDK от E2B могут переключиться на самохостинг AgentENV без изменения кода агентов. Поддерживаются развертывания через systemd, Docker, Docker Compose и Kubernetes. Требуется Linux ядро 6.8+ и доступ к /dev/kvm.

Почему это важно

Открытие AgentENV снимает одно из главных инфраструктурных препятствий для Agentic RL. Возможность мгновенного форкинга сред позволяет модели проводить тысячи параллельных экспериментов (rollouts) в идентичных условиях, что значительно ускоряет сходимость обучения сложных языковых моделей, таких как Kimi K3.

Источник: MarkTechPost ↗