Релиз модели28 июля 2026 г., 23:17 МСК🤖 Auto

AI расширяет роли: как модели меняют работу до смены должностей

Новые отчеты OpenAI и Anthropic показывают, что ИИ уже выполняет кросс-функциональные задачи, а Claude Opus 5 и Gemini 3.5 Flash-Lite задают новые стандарты качества и цены.

Баннер новости 4575

Битва титанов: Claude Opus 5 против Fable и GPT

Неделю закрытых моделей можно охарактеризовать как смешанную, но с явным лидером в бенчмарках. Claude Opus 5 занял первое место в Индексе интеллекта Artificial Analysis с результатом 61 (при максимальных усилиях), опередив Fable 5 всего на один балл. Также Opus 5 лидирует в бенчмарке агентной работы AA-Briefcase и показал прорывной результат на ARC-AGI-3 — 30.2%, что значительно превышает предыдущий рекорд GPT-5.6 Sol (Max) в 7.8%.

Однако бенчмарки не всегда отражают реальное взаимодействие. Несмотря на технические победы, пользователи отмечают, что Fable и GPT-5.6 Sol (xhigh) кажутся более «интеллектуальными» в диалоге. Opus 5, вероятно, лучше подготовлен к тестам, в то время как другие модели демонстрируют более гибкое мышление. Тем не менее, Opus 5 остается ключевым инструментом, особенно учитывая, что он потребляет 50% квоты Claude Max, недоступную для Fable.

Экономическая эффективность: Gemini 3.5 Flash-Lite

Google выпустила Gemini 3.5 Flash-Lite, которая позиционируется как лучший LLM начального уровня с реальной мультимодальностью. Модель поддерживает ввод текста, изображений, аудио, видео и PDF, генерируя более 350 токенов в секунду. Цена составляет $0.30 за миллион входных токенов и $2.50 за миллион выходных, что делает её идеальной для высоконагруженного извлечения данных из документов.

Параллельно представлен Gemini 3.6 Flash — улучшение эффективности. Google сообщает о снижении количества выходных токенов на 17% и сокращении среднего времени выполнения задачи с 2.7 до 1.3 минут. Однако индекс Artificial Analysis остался на уровне 50, что создает разрыв в 11 пунктов с Opus 5. Для сложных задач Gemini пока уступает Sol и Kimi K3.

ИИ стирает границы профессий

Ключевое исследование OpenAI, проанализировавшее более 800 000 рабочих сообщений пользователей ChatGPT, выявило тренд: ИИ расширяет роли сотрудников еще до изменения их официальных должностей. После исключения общих задач, 43.5% оставшихся сообщений относятся к кросс-ролевым задачам (работы, не входящим в прямые обязанности пользователя).

Лидерами по использованию ИИ для чужих задач стали:

  • Обслуживание клиентов: 77%
  • Дизайн: 75%
  • HR: 69%
  • Юристы: 56%
  • Маркетинг: 53%

Малые команды (2-5 человек) используют ИИ как универсала чаще (18.9% сообщений), чем крупные корпорации (16.3%), так как у них меньше специалистов для передачи задач.

Данные Anthropic: где используется Claude

В июне 2026 года доля компьютерных и математических работ в разговорах с Claude составила 21.1%, за ними следуют искусство и дизайн (12.9%) и образование (11.9%). По типам запросов лидирует создание контента (20.0%) и исследования (13.5%).

Использование ИИ сильно неравномерно географически. В округе Колумбия доля пользователей Claude в 3.32 раза превышает долю населения, в Калифорнии — в 1.62 раза, а в Западной Вирджинии — лишь в 0.25 раза. Компьютерные специалисты составляют 30% респондентов Anthropic при доле в 4% в общей занятости США.

Риски и стратегии внедрения

Исследование BCG с участием 758 консультантов показало двойственный эффект: ИИ повысил качество работы на 40% в пределах своих возможностей, но сделал пользователей на 19 процентных пунктов менее способными находить правильные ответы в задачах вне зоны компетенции модели. Группы, прошедшие краткий курс по промпт-инжинирингу, оказались наиболее уязвимы из-за ложного чувства уверенности.

Для успешного внедрения рекомендуется:

  • Обучать команды работе с контекстом, проверкой ответов и эскалацией к специалистам.
  • Переносить повторяющиеся рабочие процессы в кастомные приложения с четкими точками человеческого контроля.
  • Помнить, что токены — это метрика вовлеченности, а не бизнес-результата. Компании из 95-го процентиля используют в 3.5 раза больше токенов на сотрудника, чем типичные фирмы.

Бенчмарки

БенчмаркClaude Opus 5Fable 5GPT-5.6 Sol (Max)Gemini 3.6 Flash
Artificial Analysis Intelligence Index61score60score
ARC-AGI-330.2%7.8%
Artificial Analysis Index61score50score

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: Towards AI newsletter ↗