Релиз модели2 июля 2026 г., 11:45 МСК🤖 Auto

Fable 5 автоматизирует 16% фриланса: новый лидер RLI

Лаборатория CAIS представила результаты Remote Labor Index: Fable 5 стал первым ИИ, который качественно выполняет реальные заказы лучше половины конкурентов, обогнав GPT-5.5 и Opus 4.8.

Баннер новости 2792

Резкие скачки в автоматизации труда

Центр по безопасности ИИ (CAIS) и Scale Labs опубликовали обновленные данные Remote Labor Index (RLI). Этот бенчмарк измеряет способность ИИ-агентов выполнять реальные экономически значимые задачи фриланса — от 3D-моделирования до видеомонтажа — с качеством, приемлемым для заказчика. Ключевая метрика — автоматизация (доля проектов, где работа ИИ признана не хуже человеческой).

Результаты демонстрируют взрывной рост: за восемь месяцев поле продвинулось с 2,5% до 16,1%. Лидером стал Fable 5, показавший результат 16,1%, что почти вдвое превышает показатели ближайших преследователей. Это первый случай, когда ИИ-агент стабильно справляется с комплексными задачами на уровне, сопоставимом с профессионалами, в значительной доле случаев.

Сравнение моделей: кто на вершине?

Новые модели демонстрируют существенный отрыв от предыдущих поколений. Ниже приведена таблица с ключевыми метриками автоматизации для самых передовых моделей на момент публикации:

Модель Автоматизация (%) Примечание
Fable 5 16.1% Абсолютный лидер. Доступ ограничен властями США.
Opus 4.8 8.3% Второе место, рост в 2 раза по сравнению с Opus 4.6.
GPT-5.5 6.3% Третье место. Показал хорошие визуальные результаты, но с нюансами.
Opus 4.6 4.17% Предыдущий публичный лидер (на момент релиза RLI).
GPT-5.2 2.92% Старая версия, значительно уступает новым моделям.

Реальные кейсы: 3D, видео и архитектура

RLI оценивает не абстрактные тексты, а конкретные коммерческие заказы. В отчете приведены примеры:

  • 3D & CAD: Переработка дизайна обручального кольца. Fable 5 создал корректную 3D-модель и фотореалистичные рендеры, хотя детализация зажимов осталась на любительском уровне.
  • Видео: Создание 60-секундной анимации для компании по уходу за деревьями. Новые модели (особенно Fable 5) обеспечили плавную синхронизацию графики с голосовым файлом, чего не могли сделать предыдущие версии.
  • Архитектура: Разработка плана этажа и рендера ванной комнаты. Здесь выявился важный нюанс: GPT-5.5 сгенерировал красивый «рендер» с помощью image-генератора, но его реальная 3D-модель оказалась пустой. Fable 5 и Opus 4.8 предоставили рабочие 3D-файлы.

Почему ИИ-судьи не заменяют людей

Исследователи попытались заменить человеческих оценщиков автоматизированным «LLM-судьей». Результат провалился: автоматический судья завышал показатели новых моделей в 2,3–2,9 раза. Например, он приписал GPT-5.5 автоматизацию в 17,9% вместо реальных 6,3%.

Причина проста: оценка качества работы ИИ-агента требует таких же навыков управления ПО (computer-use), как и сама работа. ИИ-судья не может открыть проект в Blender или AutoCAD, чтобы проверить геометрию, и поэтому не замечает «фейковых» рендеров. Человеческая оценка остается золотым стандартом.

Важно для рынка труда

Рост автоматизации с 2,5% до 16,1% за полгода — это сигнал для фрилансеров в сфере дизайна, 3D-моделирования и веб-разработки. ИИ больше не просто черновик: он способен отдавать готовый продукт. Однако, как показывает кейс с GPT-5.5, критическое мышление и проверка исходных файлов (3D-моделей, кода) остаются за человеком. Рынок смещается от «создания с нуля» к «редактированию и валидации» ИИ-контента.

Бенчмарки

БенчмаркFable 5GPT-5.5Opus 4.8
Remote Labor Index (RLI)16.1%6.3%8.3%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: Safe ↗