Битва титанов: Claude Opus 5 против Fable и GPT
Неделю закрытых моделей можно охарактеризовать как смешанную, но с явным лидером в бенчмарках. Claude Opus 5 занял первое место в Индексе интеллекта Artificial Analysis с результатом 61 (при максимальных усилиях), опередив Fable 5 всего на один балл. Также Opus 5 лидирует в бенчмарке агентной работы AA-Briefcase и показал прорывной результат на ARC-AGI-3 — 30.2%, что значительно превышает предыдущий рекорд GPT-5.6 Sol (Max) в 7.8%.
Однако бенчмарки не всегда отражают реальное взаимодействие. Несмотря на технические победы, пользователи отмечают, что Fable и GPT-5.6 Sol (xhigh) кажутся более «интеллектуальными» в диалоге. Opus 5, вероятно, лучше подготовлен к тестам, в то время как другие модели демонстрируют более гибкое мышление. Тем не менее, Opus 5 остается ключевым инструментом, особенно учитывая, что он потребляет 50% квоты Claude Max, недоступную для Fable.
Экономическая эффективность: Gemini 3.5 Flash-Lite
Google выпустила Gemini 3.5 Flash-Lite, которая позиционируется как лучший LLM начального уровня с реальной мультимодальностью. Модель поддерживает ввод текста, изображений, аудио, видео и PDF, генерируя более 350 токенов в секунду. Цена составляет $0.30 за миллион входных токенов и $2.50 за миллион выходных, что делает её идеальной для высоконагруженного извлечения данных из документов.
Параллельно представлен Gemini 3.6 Flash — улучшение эффективности. Google сообщает о снижении количества выходных токенов на 17% и сокращении среднего времени выполнения задачи с 2.7 до 1.3 минут. Однако индекс Artificial Analysis остался на уровне 50, что создает разрыв в 11 пунктов с Opus 5. Для сложных задач Gemini пока уступает Sol и Kimi K3.
ИИ стирает границы профессий
Ключевое исследование OpenAI, проанализировавшее более 800 000 рабочих сообщений пользователей ChatGPT, выявило тренд: ИИ расширяет роли сотрудников еще до изменения их официальных должностей. После исключения общих задач, 43.5% оставшихся сообщений относятся к кросс-ролевым задачам (работы, не входящим в прямые обязанности пользователя).
Лидерами по использованию ИИ для чужих задач стали:
- Обслуживание клиентов: 77%
- Дизайн: 75%
- HR: 69%
- Юристы: 56%
- Маркетинг: 53%
Малые команды (2-5 человек) используют ИИ как универсала чаще (18.9% сообщений), чем крупные корпорации (16.3%), так как у них меньше специалистов для передачи задач.
Данные Anthropic: где используется Claude
В июне 2026 года доля компьютерных и математических работ в разговорах с Claude составила 21.1%, за ними следуют искусство и дизайн (12.9%) и образование (11.9%). По типам запросов лидирует создание контента (20.0%) и исследования (13.5%).
Использование ИИ сильно неравномерно географически. В округе Колумбия доля пользователей Claude в 3.32 раза превышает долю населения, в Калифорнии — в 1.62 раза, а в Западной Вирджинии — лишь в 0.25 раза. Компьютерные специалисты составляют 30% респондентов Anthropic при доле в 4% в общей занятости США.
Риски и стратегии внедрения
Исследование BCG с участием 758 консультантов показало двойственный эффект: ИИ повысил качество работы на 40% в пределах своих возможностей, но сделал пользователей на 19 процентных пунктов менее способными находить правильные ответы в задачах вне зоны компетенции модели. Группы, прошедшие краткий курс по промпт-инжинирингу, оказались наиболее уязвимы из-за ложного чувства уверенности.
Для успешного внедрения рекомендуется:
- Обучать команды работе с контекстом, проверкой ответов и эскалацией к специалистам.
- Переносить повторяющиеся рабочие процессы в кастомные приложения с четкими точками человеческого контроля.
- Помнить, что токены — это метрика вовлеченности, а не бизнес-результата. Компании из 95-го процентиля используют в 3.5 раза больше токенов на сотрудника, чем типичные фирмы.
Бенчмарки
| Бенчмарк | Claude Opus 5 | Fable 5 | GPT-5.6 Sol (Max) | Gemini 3.6 Flash |
|---|---|---|---|---|
| Artificial Analysis Intelligence Index | 61score | 60score | — | — |
| ARC-AGI-3 | 30.2% | — | 7.8% | — |
| Artificial Analysis Index | 61score | — | — | 50score |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: Towards AI newsletter ↗
