Резкие скачки в автоматизации труда
Центр по безопасности ИИ (CAIS) и Scale Labs опубликовали обновленные данные Remote Labor Index (RLI). Этот бенчмарк измеряет способность ИИ-агентов выполнять реальные экономически значимые задачи фриланса — от 3D-моделирования до видеомонтажа — с качеством, приемлемым для заказчика. Ключевая метрика — автоматизация (доля проектов, где работа ИИ признана не хуже человеческой).
Результаты демонстрируют взрывной рост: за восемь месяцев поле продвинулось с 2,5% до 16,1%. Лидером стал Fable 5, показавший результат 16,1%, что почти вдвое превышает показатели ближайших преследователей. Это первый случай, когда ИИ-агент стабильно справляется с комплексными задачами на уровне, сопоставимом с профессионалами, в значительной доле случаев.
Сравнение моделей: кто на вершине?
Новые модели демонстрируют существенный отрыв от предыдущих поколений. Ниже приведена таблица с ключевыми метриками автоматизации для самых передовых моделей на момент публикации:
| Модель | Автоматизация (%) | Примечание |
|---|---|---|
| Fable 5 | 16.1% | Абсолютный лидер. Доступ ограничен властями США. |
| Opus 4.8 | 8.3% | Второе место, рост в 2 раза по сравнению с Opus 4.6. |
| GPT-5.5 | 6.3% | Третье место. Показал хорошие визуальные результаты, но с нюансами. |
| Opus 4.6 | 4.17% | Предыдущий публичный лидер (на момент релиза RLI). |
| GPT-5.2 | 2.92% | Старая версия, значительно уступает новым моделям. |
Реальные кейсы: 3D, видео и архитектура
RLI оценивает не абстрактные тексты, а конкретные коммерческие заказы. В отчете приведены примеры:
- 3D & CAD: Переработка дизайна обручального кольца. Fable 5 создал корректную 3D-модель и фотореалистичные рендеры, хотя детализация зажимов осталась на любительском уровне.
- Видео: Создание 60-секундной анимации для компании по уходу за деревьями. Новые модели (особенно Fable 5) обеспечили плавную синхронизацию графики с голосовым файлом, чего не могли сделать предыдущие версии.
- Архитектура: Разработка плана этажа и рендера ванной комнаты. Здесь выявился важный нюанс: GPT-5.5 сгенерировал красивый «рендер» с помощью image-генератора, но его реальная 3D-модель оказалась пустой. Fable 5 и Opus 4.8 предоставили рабочие 3D-файлы.
Почему ИИ-судьи не заменяют людей
Исследователи попытались заменить человеческих оценщиков автоматизированным «LLM-судьей». Результат провалился: автоматический судья завышал показатели новых моделей в 2,3–2,9 раза. Например, он приписал GPT-5.5 автоматизацию в 17,9% вместо реальных 6,3%.
Причина проста: оценка качества работы ИИ-агента требует таких же навыков управления ПО (computer-use), как и сама работа. ИИ-судья не может открыть проект в Blender или AutoCAD, чтобы проверить геометрию, и поэтому не замечает «фейковых» рендеров. Человеческая оценка остается золотым стандартом.
Важно для рынка труда
Рост автоматизации с 2,5% до 16,1% за полгода — это сигнал для фрилансеров в сфере дизайна, 3D-моделирования и веб-разработки. ИИ больше не просто черновик: он способен отдавать готовый продукт. Однако, как показывает кейс с GPT-5.5, критическое мышление и проверка исходных файлов (3D-моделей, кода) остаются за человеком. Рынок смещается от «создания с нуля» к «редактированию и валидации» ИИ-контента.
Бенчмарки
| Бенчмарк | Fable 5 | GPT-5.5 | Opus 4.8 |
|---|---|---|---|
| Remote Labor Index (RLI) | 16.1% | 6.3% | 8.3% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: Safe ↗
