Релиз модели26 сентября 2026 г., 07:19 МСК🤖 Auto

Opus 5.5, дешевый GPT-6 и Jev: Итоги Dreamforce и новые модели

Anthropic выпустила Opus 5.5, OpenAI снизила цены на GPT-6, а TypeSafe AI представила Jev для быстрых классификаций. Разбор ключевых событий недели.

Баннер новости 8325

Opus 5.5: Исправление ошибок и лидерство в бенчмарках

Anthropic представила Opus 5.5, модель, которая, по мнению редакции Towards AI, стала явным победителем в задачах написания текста. В отличие от предыдущей версии Opus 5, которая критиковалась за «аннотационный» стиль и оптимизацию под бенчмарки, Opus 5.5 демонстрирует более естественное общение. Сравнение 1000 промптов показало, что новая модель использует маркеры вроде «in short» на 83% реже, хотя их частота все же выросла с 9 до 100 случаев.

По данным Artificial Analysis Intelligence Index, Opus 5.5 набрала 58 баллов, опередив GPT-6 Astra (53), Sol (48) и Luna (37) при максимальных усилиях. Однако OpenAI Astra остается сильным конкурентом в создании заголовков и структуры статей.

OpenAI: GPT-6 Sol и Luna стали значительно дешевле

OpenAI радикально снизила цены на модели GPT-6 Sol и Luna, сделав их идеальными кандидатами для использования в качестве субагентов в сложных рабочих процессах. При стандартных тарифах API для промптов до 272 000 токенов входные и выходные цены сократились вдвое по сравнению с GPT-5.6.

Модель Цена за 1 млн входных токенов Цена за 1 млн выходных токенов Снижение цен
GPT-6 Sol $2 $10 50% (вход), ~50% (выход)
GPT-6 Luna $0.10 $0.50 50% (вход), ~58% (выход)
Opus 5.5 На 20% дешевле Opus 5 20%

Такая ценовая политика позволяет масштабировать агентов: Astra координирует задачи в Ultra-режиме, Sol и Luna выполняют рутинные операции, а сильные модели проверяют результаты. Это делает экономически выгодным запуск множества независимых проверок перед финальным утверждением ответа.

TypeSafe AI Jev: Быстрая классификация без галлюцинаций

Компания TypeSafe AI представила модель Jev, работающую по принципу «System One» с использованием Reinforcement Learning for Calibrated Decisions (RLCD). Jev не генерирует свободный текст, а возвращает значения в заданном пространстве (Noul, Choice, Score), что исключает галлюцинации вне заданных опций. Модель предназначена для быстрых решений, требующих параллельной обработки запросов.

Стоимость использования Jev составляет всего $0.042 за 1 млн входных токенов. Независимое тестирование от AY Automate показало медианную задержку 0.33 секунды (против 0.67 у Gemini 3.5 Flash-Lite). В сценарии каскадной обработки 160 сообщений в банковском секторе гибридная система (Jev + GPT-5.6 Terra) достигла точности 90.0% при затратах всего 25.7% от стоимости использования только Terra.

Dreamforce: Агенты в Slack и споры о безопасности

На конференции Dreamforce Salesforce и Slack представили обновленные инструменты для корпоративных агентов. Slackforce Surfaces позволяет Slackbot преобразовывать данные из Salesforce и переписки в дашборды и отчеты. Важным нововведением стал Slack Code, создающий выделенные каналы для совместной работы над задачами агентов, где разработчики могут проверять diff-ы кода и превью.

Rob Seaman, генеральный менеджер Slack, отметил, что ускорение генерации кода привело к увеличению объема работы по ревью. Однако совместная работа в Slack позволяет коллегам видеть контекст и ошибки друг друга, снижая риски. На мероприятии также прозвучали разные взгляды на безопасность: Дарио Амодеи призвал к скоординированным мерам, а Дженсен Хуанг заявил, что безопасность и скорость развития могут идти рука об руку.

Источник: Towards AI newsletter ↗