Прорыв в «знанийной» работе
Команда NeoCognition представила ApprenticeBench — первый в мире бенчмарк, оценивающий способность ИИ-агентов осваивать полноценную работу (knowledge job) с нуля. В отличие от старых тестов, проверяющих отдельные навыки, ApprenticeBench симулирует реальный рабочий процесс: бухгалтера отдела расчетов с поставщиками (AP) в строительной компании Acme Home Builders.
Агенты должны были не просто «ответить на вопрос», а:
- Использовать графический интерфейс (GUI) ERP-системы Odoo.
- Изучать внутренние регламенты компании (handbook) и исторические данные.
- Проводить коммуникацию с поставщиками для исправления ошибок в счетах.
- Адаптироваться к изменениям политик компании в режиме реального времени (continual learning).
Результаты: Fable 5.1 и GPT-6 Astra лидируют
Эксперимент длился с мая по сентябрь 2026 года. Изначально агенты получали детальную обратную связь от менеджера, но с июня переходили на редкий контроль. Ключевым показателем стала кумулятивная доля успешных задач. Лидеры обогнали лучшего человеческого тестировщика (51%) примерно на 20-23%.
| Модель / Агент | Успешность (Success Rate) | Примечание |
|---|---|---|
| Fable 5.1 (Anthropic) | 72% | Лучший результат, +21% над людьми |
| GPT-6 Astra (OpenAI) | 68% | Второе место, +17% над людьми |
| Лучший человек | 51% | База для сравнения |
| Opus 4.6 / GPT-5.4 | ~43-45% | Ниже человеческого уровня |
| Большинство других (Gemini, Grok, Kimi) | < 25% | Слабые результаты на GUI |
Конец «налога на GUI»
Ранее модели сильно теряли в эффективности при работе через графический интерфейс по сравнению с API. Fable 5.1 и GPT-6 Astra впервые показали, что могут использовать GUI так же эффективно, как и прямые вызовы API. Это критически важно, так как большинство корпоративных систем (ERP, CRM) не имеют открытых API для всех функций, но имеют веб-интерфейсы.
Парадокс стоимости и обучения
Несмотря на технологический прорыв, NeoCognition отмечают экономический нюанс: стоимость использования ИИ-агентов для этой задачи уже превысила стоимость найма человеческого профессионала. Это создает барьер для немедленного внедрения, несмотря на превосходство в качестве.
Также обнаружено различие в поведении обучения: люди становятся эффективнее со временем, тогда как агенты, несмотря на накопление памяти (memory notes), демонстрируют обратную динамику или плато, что указывает на необходимость новых архитектур для долгосрочного обучения в реальных условиях.
Источник: Neocognition ↗
