Релиз модели3 июля 2026 г., 00:16 МСК🤖 Auto

Fable 5 от Anthropic: новый рекорд в AI-фрилансе, но люди всё ещё нужны

Модель Fable 5 от Anthropic установила рекорд в 16,1% автоматизации реальных freelance-задач по бенчмарку CAIS, обогнав GPT-5.5 и Opus 4.8, однако полная замена человека пока невозможна.

Баннер новости 2820

Рекордные показатели на Remote Labor Index

После кратковременной приостановки работы, модель Fable 5 от Anthropic официально возобновила работу 30 июня 2026 года. Её ключевое достижение — лидерство в Remote Labor Index (RLI), бенчмарке Центра безопасности ИИ (CAIS), который оценивает способность агентов выполнять реальные экономически значимые задачи (дизайн, анализ данных, видео) на уровне, приемлемом для платящего клиента.

Результаты тестирования показали, что Fable 5 достигла показателя автоматизации в 16,1%. Это вдвое превышает показатели ближайших конкурентов и более чем в четыре раза превосходит предыдущего лидера (Opus 4.6 с 4,17%).

Сравнение с конкурентами

В тестировании участвовали три флагманские модели. Ниже приведены их результаты по уровню автоматизации задач, которые были оценены как «качественные или превосходящие человеческие»:

Модель Производитель Результат RLI (%) Примечание
Fable 5 Anthropic 16,1% Новый рекорд. Даже при худшем сценарии (отсев всех незавершенных задач) результат составил бы 14,6%.
Opus 4.8 Anthropic 8,3% Предыдущий лидер в паре с Fable 5, но уступает новой версии.
GPT-5.5 OpenAI 6,3% Заняла третье место, но также превзошла все ранее оцененные модели.

Почему AI ещё не заменит фрилансеров

Несмотря на впечатляющий рост (поле продвинулось с 2,5% до 16% за 8 месяцев), полная замена человека далека. CAIS выделил несколько критических барьеров:

  • Проблема оценки качества: Попытка заменить человеческого оценщика на «LLM-судью» провалилась. Оценка работы требует открытия файлов в профессиональных приложениях и формирования суждения, что является сложной агентной задачей, с которой современные модели пока не справляются.
  • Безопасность и внедрение: Компании сталкиваются с проблемами безопасности и сложными процессами интеграции AI-инструментов.
  • Необходимость контроля: Для полной автоматизации требуется сеть агентов для проверки качества, бюджета и сроков, что делает замену не прямолинейной.

Парадокс времени и сложности

Исследование CAIS также выявило интересный парадокс: время, затрачиваемое человеком на задачу, не всегда коррелирует со сложностью для AI. Например, AI может создать цифровое искусство или написать код за минуты, тогда как человеку это потребовало бы часов. Однако задачи, требующие быстрого профессионального вмешательства (например, транскрипция музыки или тестирование игр в реальном времени), остаются вне досягаемости для текущих моделей.

Таким образом, Fable 5 демонстрирует экспоненциальный рост агентных способностей, но до массового вытеснения специалистов-фрилансеров еще далеко из-за ограничений в оценке качества и специфических навыках использования интерфейсов.

Бенчмарки

БенчмаркFable 5GPT-5.5Opus 4.8
Remote Labor Index (RLI)16.1%6.3%8.3%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: ZDNet AI ↗