Релиз модели2 августа 2026 г., 17:46 МСК🤖 Auto

Ouroboros: AI-агент с памятью и самообучением побил Codex и Claude Code

Открытый AI-агент Ouroboros занял позицию #SOTA на Terminal-Bench, OSWorld и CL-Bench, превзойдя проприетарные решения от OpenAI и Anthropic за счет автономной эволюции кода и долговременной памяти.

Баннер новости 4908

Автономная эволюция и непрерывность

Ouroboros — это не просто чат-бот, а самообучающийся AI-агент, способный изменять собственную архитектуру, промпты, инструменты и зависимости. Ключевая особенность проекта — сохранение идентичности, истории и «долгой памяти» (durable memory) между перезапусками. Агент работает как нативное десктопное приложение, так и через CLI, используя локальные GGUF-модели или удаленные API. Репозиторий хранится на машине пользователя, что обеспечивает полный контроль над данными.

Проект стартовал 16 февраля 2026 года. За первые 48 часов работы он прошел 32 цикла эволюции, обновившись с ветки v4.1 до версии v6.2.0. Агент способен координировать рой специализированных агентов, работать с внешними Git-репозиториями и проводить рефлексию, не теряя контекста.

Результаты бенчмарков: обгон лидеров

Разработчики Ouroboros представили воспроизводимые результаты, демонстрирующие лидерство (SOTA) в сравнении с Codex, Claude Code, Cursor и Hermes. Важно отметить, что сравнение проводилось при использовании одинаковых базовых моделей (model-matched), что исключает преимущество только за счет мощности «железа» или провайдера. На SWE-bench Pro результаты статистически равны с Codex CLI, а на GAIA — близки к Claude Code.

Бенчмарк Модель Результат Ouroboros Сравнение (Конкуренты) Статус
Terminal-Bench 2.1 Claude Opus-5 high 86.74% Claude Code + Fable 5: 83.8% Self-reported, submission open
Terminal-Bench 2.1 Grok-4.5 84.94% Cursor CLI: 79.3% · Hermes: 77.53% Self-reported, submission open
Terminal-Bench 2.1 GPT-5.5 84.3% Codex CLI: 83.1% Self-reported, public run
OSWorld-Verified Claude Opus-5 90.69% Предыдущий лучший: 90.19% Self-reported, full traces
CL-Bench Claude Sonnet-4.6 0.2301 (Rank 1) Предыдущий топ: 0.1960 Self-reported, submission open
SWE-bench Pro GPT-5.6-luna 58.2% Codex CLI: 59.4% (нет значимой разницы) Self-reported, matched traces
GAIA Claude Sonnet-5 129/165 (78.2%) Claude Code: 131/165 (79.4%) Scrubbed trace capsule pending

Техническая реализация и установка

Ouroboros поддерживает macOS (Apple Silicon 12+), Linux (x86_64) и Windows (x64). Установка возможна через готовые бинарные файлы (.dmg, .tar.gz, .zip) или из исходного кода. Для работы требуется Python 3.10+ и Git. Агент использует систему «Project Rooms» для организации долгосрочных задач, ведения журналов и хранения знаний, связанных с единой идентичностью агента.

Код доступен на GitHub, где размещены адаптеры для бенчмарков, скрипты запуска и документация (BIBLE.md, ARCHITECTURE.md). Разработчики подчеркивают прозрачность: все изменения кода фиксируются в Git, а результаты бенчмарков сопровождаются полными трейсами (traces) для верификации.

Почему это важно

Успех Ouroboros демонстрирует сдвиг парадигмы от статических LLM к автономным агентам, способным к саморефлексии и модификации собственного кода. Обгон проприетарных решений (Codex, Claude Code) на открытых бенчмарках при использовании тех же базовых моделей указывает на эффективность архитектурных решений в области управления памятью и координации подзадач. Это открывает путь к созданию более надежных и предсказуемых AI-ассистентов для разработки ПО.

Бенчмарки

БенчмаркOuroborosClaude CodeClaude Code + Fable 5Codex CLICursor CLIHermesPointer
Terminal-Bench 2.186.74%83.8%
Terminal-Bench 2.180.22%78.9%
Terminal-Bench 2.184.3%83.1%
Terminal-Bench 2.184.94%79.3%77.53%
OSWorld-Verified83.27%81.45%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: Github ↗