Автономная эволюция и непрерывность
Ouroboros — это не просто чат-бот, а самообучающийся AI-агент, способный изменять собственную архитектуру, промпты, инструменты и зависимости. Ключевая особенность проекта — сохранение идентичности, истории и «долгой памяти» (durable memory) между перезапусками. Агент работает как нативное десктопное приложение, так и через CLI, используя локальные GGUF-модели или удаленные API. Репозиторий хранится на машине пользователя, что обеспечивает полный контроль над данными.
Проект стартовал 16 февраля 2026 года. За первые 48 часов работы он прошел 32 цикла эволюции, обновившись с ветки v4.1 до версии v6.2.0. Агент способен координировать рой специализированных агентов, работать с внешними Git-репозиториями и проводить рефлексию, не теряя контекста.
Результаты бенчмарков: обгон лидеров
Разработчики Ouroboros представили воспроизводимые результаты, демонстрирующие лидерство (SOTA) в сравнении с Codex, Claude Code, Cursor и Hermes. Важно отметить, что сравнение проводилось при использовании одинаковых базовых моделей (model-matched), что исключает преимущество только за счет мощности «железа» или провайдера. На SWE-bench Pro результаты статистически равны с Codex CLI, а на GAIA — близки к Claude Code.
| Бенчмарк | Модель | Результат Ouroboros | Сравнение (Конкуренты) | Статус |
|---|---|---|---|---|
| Terminal-Bench 2.1 | Claude Opus-5 high | 86.74% | Claude Code + Fable 5: 83.8% | Self-reported, submission open |
| Terminal-Bench 2.1 | Grok-4.5 | 84.94% | Cursor CLI: 79.3% · Hermes: 77.53% | Self-reported, submission open |
| Terminal-Bench 2.1 | GPT-5.5 | 84.3% | Codex CLI: 83.1% | Self-reported, public run |
| OSWorld-Verified | Claude Opus-5 | 90.69% | Предыдущий лучший: 90.19% | Self-reported, full traces |
| CL-Bench | Claude Sonnet-4.6 | 0.2301 (Rank 1) | Предыдущий топ: 0.1960 | Self-reported, submission open |
| SWE-bench Pro | GPT-5.6-luna | 58.2% | Codex CLI: 59.4% (нет значимой разницы) | Self-reported, matched traces |
| GAIA | Claude Sonnet-5 | 129/165 (78.2%) | Claude Code: 131/165 (79.4%) | Scrubbed trace capsule pending |
Техническая реализация и установка
Ouroboros поддерживает macOS (Apple Silicon 12+), Linux (x86_64) и Windows (x64). Установка возможна через готовые бинарные файлы (.dmg, .tar.gz, .zip) или из исходного кода. Для работы требуется Python 3.10+ и Git. Агент использует систему «Project Rooms» для организации долгосрочных задач, ведения журналов и хранения знаний, связанных с единой идентичностью агента.
Код доступен на GitHub, где размещены адаптеры для бенчмарков, скрипты запуска и документация (BIBLE.md, ARCHITECTURE.md). Разработчики подчеркивают прозрачность: все изменения кода фиксируются в Git, а результаты бенчмарков сопровождаются полными трейсами (traces) для верификации.
Почему это важно
Успех Ouroboros демонстрирует сдвиг парадигмы от статических LLM к автономным агентам, способным к саморефлексии и модификации собственного кода. Обгон проприетарных решений (Codex, Claude Code) на открытых бенчмарках при использовании тех же базовых моделей указывает на эффективность архитектурных решений в области управления памятью и координации подзадач. Это открывает путь к созданию более надежных и предсказуемых AI-ассистентов для разработки ПО.
Бенчмарки
| Бенчмарк | Ouroboros | Claude Code | Claude Code + Fable 5 | Codex CLI | Cursor CLI | Hermes | Pointer |
|---|---|---|---|---|---|---|---|
| Terminal-Bench 2.1 | 86.74% | — | 83.8% | — | — | — | — |
| Terminal-Bench 2.1 | 80.22% | 78.9% | — | — | — | — | — |
| Terminal-Bench 2.1 | 84.3% | — | — | 83.1% | — | — | — |
| Terminal-Bench 2.1 | 84.94% | — | — | — | 79.3% | 77.53% | — |
| OSWorld-Verified | 83.27% | — | — | — | — | — | 81.45% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: Github ↗
