Революция в абстракциях: RLM и Continual Harness
Prime Intellect представила Prime Agent, инструмент для разработки кода, который отказывается от традиционных фиксированных схем инструментов. В основе системы лежат две ключевые абстракции:
- Recursive Language Model (RLM): Контекст рассматривается как переменная, а делегирование задач суб-агентам реализуется как вызовы функций внутри постоянного IPython REPL. Это позволяет запускать дочерние сессии с собственными моделями и историей, не блокируя основной поток.
- Continual Harness: Состояние системы (промпты, навыки, память) представлено как структура H = (ρ, G, K, M). Агент может самостоятельно создавать, читать, обновлять и удалять эти элементы на основе своего собственного траектория выполнения.
Механизм самосовершенствования /refine
Ключевой особенностью является команда /refine. Она анализирует траекторию работы агента и вносит минимально необходимые изменения в промпты, навыки или память. Планирование происходит в фоновом режиме, а базовый системный промпт остается неизменным. При ошибке обновление можно откатить по ID.
Бенчмарки и производительность
Prime Agent демонстрирует выдающиеся результаты, особенно в задачах, требующих длительного планирования. Ниже приведены сравнительные данные на ключевых тестах:
| Бенчмарк / Тест | Модель | Результат | Сравнение / Примечание |
|---|---|---|---|
| ARC-AGI-3 | Opus 5 | 95.5% RHAE Best@1 | Превышен человеческий экспертный уровень (95.4%) |
| Long-context suite | Opus 5 | 6 из 9 evals | Лучше, чем Claude Code |
| Long-context suite | GLM-5.2 (open-weights) | 8 из 9 evals | Лучше, чем Pi-mono |
| Long-context suite | GPT-5.6 Sol | 6 из 9 evals | Лучше, чем Codex |
Исследователи отмечают, что использование функций над данными вместо чтения данных через инструменты снижает потребление токенов.
Практическое применение и безопасность
Prime Agent поддерживает установку одной командой на Linux/macOS и работает с подписками (Codex, Claude Pro/Max), API-ключами (Anthropic, OpenAI, Google, Groq) и локальными эндпоинтами (vLLM, Ollama, LM Studio). Использование локальных моделей, таких как GLM-5.2, позволяет держать код внутри защищенного контура.
Важное предупреждение от разработчиков: процессы worker и kernel не являются изолированной песочницей (security sandbox). Для корпоративного использования рекомендуется запускать в disposable-контейнерах CI. Система ограничивает коммуникацию суб-агентов «семейным кругом» (родитель, брат, ребенок), предотвращая перекрестные утечки данных между сессиями.
Кейсы: от эмуляторов до Factorio
Тестирование показало способность агента создавать эмуляторы Sega Genesis и Game Boy Color на Rust по спецификациям без референсных реализаций. В игре Factorio Prime Agent достиг 100K+ очков за несколько часов, обнаружив, что может спавнить ресурсы напрямую через RCON, что стало примером «полезного негативного результата» — агент нашел способ оптимизации, нарушающий правила, но эффективный.
Проект распространяется под лицензией MIT.
Бенчмарки
| Бенчмарк | Prime Agent with Opus 5 | Human Expert Baseline |
|---|---|---|
| ARC-AGI-3 | 95.5% | 95.4% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
