Opus 5.5: Исправление ошибок и лидерство в бенчмарках
Anthropic представила Opus 5.5, модель, которая, по мнению редакции Towards AI, стала явным победителем в задачах написания текста. В отличие от предыдущей версии Opus 5, которая критиковалась за «аннотационный» стиль и оптимизацию под бенчмарки, Opus 5.5 демонстрирует более естественное общение. Сравнение 1000 промптов показало, что новая модель использует маркеры вроде «in short» на 83% реже, хотя их частота все же выросла с 9 до 100 случаев.
По данным Artificial Analysis Intelligence Index, Opus 5.5 набрала 58 баллов, опередив GPT-6 Astra (53), Sol (48) и Luna (37) при максимальных усилиях. Однако OpenAI Astra остается сильным конкурентом в создании заголовков и структуры статей.
OpenAI: GPT-6 Sol и Luna стали значительно дешевле
OpenAI радикально снизила цены на модели GPT-6 Sol и Luna, сделав их идеальными кандидатами для использования в качестве субагентов в сложных рабочих процессах. При стандартных тарифах API для промптов до 272 000 токенов входные и выходные цены сократились вдвое по сравнению с GPT-5.6.
| Модель | Цена за 1 млн входных токенов | Цена за 1 млн выходных токенов | Снижение цен |
|---|---|---|---|
| GPT-6 Sol | $2 | $10 | 50% (вход), ~50% (выход) |
| GPT-6 Luna | $0.10 | $0.50 | 50% (вход), ~58% (выход) |
| Opus 5.5 | На 20% дешевле Opus 5 | 20% | |
Такая ценовая политика позволяет масштабировать агентов: Astra координирует задачи в Ultra-режиме, Sol и Luna выполняют рутинные операции, а сильные модели проверяют результаты. Это делает экономически выгодным запуск множества независимых проверок перед финальным утверждением ответа.
TypeSafe AI Jev: Быстрая классификация без галлюцинаций
Компания TypeSafe AI представила модель Jev, работающую по принципу «System One» с использованием Reinforcement Learning for Calibrated Decisions (RLCD). Jev не генерирует свободный текст, а возвращает значения в заданном пространстве (Noul, Choice, Score), что исключает галлюцинации вне заданных опций. Модель предназначена для быстрых решений, требующих параллельной обработки запросов.
Стоимость использования Jev составляет всего $0.042 за 1 млн входных токенов. Независимое тестирование от AY Automate показало медианную задержку 0.33 секунды (против 0.67 у Gemini 3.5 Flash-Lite). В сценарии каскадной обработки 160 сообщений в банковском секторе гибридная система (Jev + GPT-5.6 Terra) достигла точности 90.0% при затратах всего 25.7% от стоимости использования только Terra.
Dreamforce: Агенты в Slack и споры о безопасности
На конференции Dreamforce Salesforce и Slack представили обновленные инструменты для корпоративных агентов. Slackforce Surfaces позволяет Slackbot преобразовывать данные из Salesforce и переписки в дашборды и отчеты. Важным нововведением стал Slack Code, создающий выделенные каналы для совместной работы над задачами агентов, где разработчики могут проверять diff-ы кода и превью.
Rob Seaman, генеральный менеджер Slack, отметил, что ускорение генерации кода привело к увеличению объема работы по ревью. Однако совместная работа в Slack позволяет коллегам видеть контекст и ошибки друг друга, снижая риски. На мероприятии также прозвучали разные взгляды на безопасность: Дарио Амодеи призвал к скоординированным мерам, а Дженсен Хуанг заявил, что безопасность и скорость развития могут идти рука об руку.
Источник: Towards AI newsletter ↗
