Инструменты13 сентября 2026 г., 15:47 МСК🤖 Auto

ApprenticeBench: ИИ превзошел людей в бухгалтерии, но стал дороже

NeoCognition представили первый энд-ту-энд бенчмарк ApprenticeBench. Модели Fable 5.1 и GPT-6 Astra показали успех 72% и 68% в реальной работе, обогнав лучших людей, но их стоимость превысила зарплату сотрудника.

Баннер новости 7392

Прорыв в «знанийной» работе

Команда NeoCognition представила ApprenticeBench — первый в мире бенчмарк, оценивающий способность ИИ-агентов осваивать полноценную работу (knowledge job) с нуля. В отличие от старых тестов, проверяющих отдельные навыки, ApprenticeBench симулирует реальный рабочий процесс: бухгалтера отдела расчетов с поставщиками (AP) в строительной компании Acme Home Builders.

Агенты должны были не просто «ответить на вопрос», а:

  • Использовать графический интерфейс (GUI) ERP-системы Odoo.
  • Изучать внутренние регламенты компании (handbook) и исторические данные.
  • Проводить коммуникацию с поставщиками для исправления ошибок в счетах.
  • Адаптироваться к изменениям политик компании в режиме реального времени (continual learning).

Результаты: Fable 5.1 и GPT-6 Astra лидируют

Эксперимент длился с мая по сентябрь 2026 года. Изначально агенты получали детальную обратную связь от менеджера, но с июня переходили на редкий контроль. Ключевым показателем стала кумулятивная доля успешных задач. Лидеры обогнали лучшего человеческого тестировщика (51%) примерно на 20-23%.

Модель / Агент Успешность (Success Rate) Примечание
Fable 5.1 (Anthropic) 72% Лучший результат, +21% над людьми
GPT-6 Astra (OpenAI) 68% Второе место, +17% над людьми
Лучший человек 51% База для сравнения
Opus 4.6 / GPT-5.4 ~43-45% Ниже человеческого уровня
Большинство других (Gemini, Grok, Kimi) < 25% Слабые результаты на GUI

Конец «налога на GUI»

Ранее модели сильно теряли в эффективности при работе через графический интерфейс по сравнению с API. Fable 5.1 и GPT-6 Astra впервые показали, что могут использовать GUI так же эффективно, как и прямые вызовы API. Это критически важно, так как большинство корпоративных систем (ERP, CRM) не имеют открытых API для всех функций, но имеют веб-интерфейсы.

Парадокс стоимости и обучения

Несмотря на технологический прорыв, NeoCognition отмечают экономический нюанс: стоимость использования ИИ-агентов для этой задачи уже превысила стоимость найма человеческого профессионала. Это создает барьер для немедленного внедрения, несмотря на превосходство в качестве.

Также обнаружено различие в поведении обучения: люди становятся эффективнее со временем, тогда как агенты, несмотря на накопление памяти (memory notes), демонстрируют обратную динамику или плато, что указывает на необходимость новых архитектур для долгосрочного обучения в реальных условиях.

Источник: Neocognition ↗