Новости про GPT-5.5
74 материалов с упоминанием GPT-5.5: релизы, бенчмарки, изменения цен. Полные характеристики, провайдеры и сравнения — в карточке модели.
-
S1-Omni: Единая модель AI4S, победившая GPT-5.5 и Gemini-3.1
Исследователи представили S1-Omni — мультимодальную модель для науки, объединяющую понимание, предсказание и генерацию. Модель превосходит флагманы GPT-5.5 и Gemini-3.1-Pro в научных бенчмарках.
-
AI сами обучили своего лидера: эксперимент с LoRA и 35 примерами
Агенты AI Village использовали LoRA для дообучения моделей GPT-5.5, Opus 4.7 и Kimi K2.6. Результат: лидер стал «управленцем-делегатором» с ограниченным набором данных, что выявило проблемы в амбициях и оценке способност
-
Doom как бенчмарк: GPT-5.5 доминирует в битве ИИ-агентов
Rootly AI Labs превратили классический шутер DOOM в арену для тестирования ИИ. GPT-5.5 показала 66.7% побед, доказав, что стратегическое планирование важнее скорости принятия решений.
-
OpenAI представил GPT-Red: ИИ-хакер, победивший людей в тесте на инъекции
OpenAI опубликовала детали внутреннего инструмента GPT-Red — модели для автоматического поиска уязвимостей, которая превзошла человеческих экспертов по эффективности атак на собственные модели компании.
-
AI-гонка: Grok 4.5 и GPT-5.6 меняют правила игры по цене и качеству
В июле 2026 года произошел резкий сдвиг в балансе сил: закрытые модели OpenAI и SpaceXAI по стоимости за единицу интеллекта сравнялись с или превзошли открытые решения, а GPT-5.6 стала доступна всем.
-
Коэффициент верности CoT: почему сложные задачи делают LLM прозрачными
Новое исследование на 11 моделях от Google, OpenAI и Anthropic подтверждает: когда LLM приходится вычислять ответ, а не просто цитировать подсказку, они становятся прозрачными для мониторинга.
-
NVIDIA NeMo + Codex: Автономный RL-исследования с ростом точности до 96.9%
NVIDIA демонстрирует, как связка NeMo RL, NeMo Gym и агента Codex (GPT-5.5) автоматизирует полный цикл RL-исследований, включая создание сред и обучение моделей.
-
OpenAI GPT-5.6: Sol, Terra, Luna — цены, бенчмарки и роль «рабочей лошадки»
OpenAI представила линейку GPT-5.6: флагман Sol, бюджетные Terra и Luna. Sol позиционируется как агент-исполнитель, превосходящий конкурентов в коде, но уступающий Fable в сложных рассуждениях.
-
Meta Muse Spark 1.1: Агенты, 1M контекст и API для конкурентов
Meta Superintelligence Labs выпустила закрытую модель Muse Spark 1.1 с упором на агентные задачи. Это первый платный API Meta для флагманских моделей, совместимый с OpenAI SDK.
-
OpenAI представила GPT-5.6: прямой вызов Anthropic в скорости, цене и агентах
OpenAI выпустила модель GPT-5.6 Sol, которая бьет Claude Fable 5 по скорости и стоимости, а также анонсировала ChatGPT Work — конкурента Claude Cowork для автоматизации офисных задач.
-
OpenAI удвоила награду за взлом GPT-5.5/5.6 до $50k
OpenAI трансформировала разовый конкурс в постоянную программу Bio Bounty, увеличив вознаграждение за универсальные обходы биобезопасности с $25 000 до $50 000.
-
OpenAI представила GPT-5.6: Sol, Terra и Luna с рекордной эффективностью
OpenAI вывела на рынок семейство моделей GPT-5.6. Флагман Sol бьет рекорды в коде и науке, а новые модели Terra и Luna предлагают производительность уровня прошлых флагманов при стоимости в 1/16.
-
SageMath + LLM: Прорыв в математике с приростом точности до 27.8%
Исследование показывает, что интеграция системы компьютерной алгебры SageMath в агентов на базе LLM дает прирост точности до 27.8% на сложных задачах. GPT-5.5 достигла 75.2% решения, а разрыв между открытыми и закрытыми
-
SpaceXAI выпустила Grok 4.5: 4.2x эффективнее Opus 4.8 за $2/млн токенов
SpaceXAI представила Grok 4.5 — модель для кодинга и агентов, обученную совместно с Cursor. Новинка бьет рекорды по эффективности токенов и стоит дешевле конкурентов.
-
xAI представила Grok 4.5: лидер в коде, скорость 80 TPS и цена $2/млн токенов
SpaceXAI выпустила Grok 4.5 — первую модель, заточенную под агентов и разработку. Она обходит конкурентов в бенчмарках SWE Bench, работает в 4.2 раза эффективнее по токенам и стоит дешевле аналогов.
-
Cursor и SpaceXAI выпустили Grok 4.5: новый флагман для сложных задач
Cursor совместно с SpaceXAI представил Grok 4.5 — первую модель, обученную не только для кода, но и для широкого спектра интеллектуальных задач. Флагман уровня Opus доступен в Cursor с удвоенным лимитом на первую неделю.
-
OpenAI представила GPT-Live: голосовые модели с full-duplex и делегированием GPT-5.5
OpenAI выпустила GPT-Live и GPT-Live-1 mini для ChatGPT. Новые модели поддерживают одновременное слушание и говорение, а сложные задачи делегируют фоновой модели GPT-5.5.
-
Agent Arena: Claude Opus 4.7 (Thinking) и GPT 5.5 лидируют в реальном тесте
Arena.ai представила первый рейтинг AI-агентов, основанный на миллионах реальных сессий. Методология «causal tracing» выявила, что Claude Opus 4.7 (Thinking) и GPT 5.5 (High) показывают наилучший баланс эффективности и с
-
LongCat-2.0: 1.6 трлн параметров, MIT-лицензия и победа над Gemini 3.1 Pro
Meituan выпустила первую полностью открытую LLM с архитектурой MoE на 1.6 трлн параметров. Модель демонстрирует лидерство в задачах программирования и обходит проприетарные аналоги, используя собственные AI-ASIC.
-
Meituan выпустила LongCat-2.0: 1.6 трлн параметров и 1M контекста на отечественных ASIC
Meituan представила открытую MoE-модель LongCat-2.0 с 1.6 трлн параметров и нативным контекстом в 1 млн токенов. Обучение и инференс прошли полностью на китайских AI-ASIC без использования NVIDIA.
-
GPT-5.6 и Claude Fable 5: анализ эффективности токенов и бенчмарков
Анализ Pareto-фронт оптимизации показывает, что производительность LLM растет логарифмически, а лимит кодовых задач составляет ~70% независимо от вычислений.
-
pxpipe: как превращение текста в картинки снизило счет за Claude на 70%
Проект pxpipe предлагает радикальный метод экономии токенов в LLM: прокси-сервер конвертирует объемный контекст (системные промпты, логи, историю) в PNG-изображения. Это снижает затраты на 59–70% за счет более высокой пл
-
NVIDIA представила ASPIRE: роботы, которые учатся на ошибках
NVIDIA, совместно с ведущими университетами, выпустила фреймворк ASPIRE. Это система непрерывного обучения, которая не просто пишет код для роботов, но и сохраняет успешные решения в библиотеку навыков, достигая 31% успе
-
Thinking Machines: Как обучить LLM инвестиционному чутью лучше GPT и Claude
Лаборатория Thinking Machines показала, что промпт-инжиниринг не спасает фронтьер-модели от ошибок в финансах. Их кастомная модель на базе Qwen3-235B превзошла GPT-5.4 и Claude по точности фильтрации информации, затратив
-
Fable 5 в Veai: бьет GPT-5.5 и Opus 4.8 по SWE-Bench Pro
Модель Fable 5 доступна в Veai, демонстрируя лидерство в коде и кибербезопасности. Однако высокая стоимость токенов требует осторожности.
-
Fable 5 от Anthropic: новый рекорд в AI-фрилансе, но люди всё ещё нужны
Модель Fable 5 от Anthropic установила рекорд в 16,1% автоматизации реальных freelance-задач по бенчмарку CAIS, обогнав GPT-5.5 и Opus 4.8, однако полная замена человека пока невозможна.
-
Fable 5 автоматизирует 16% фриланса: новый лидер RLI
Лаборатория CAIS представила результаты Remote Labor Index: Fable 5 стал первым ИИ, который качественно выполняет реальные заказы лучше половины конкурентов, обогнав GPT-5.5 и Opus 4.8.
-
Anthropic вернул Claude Fable 5: новые фильтры, цены и сравнение с GLM-5.2
После приостановки из-за экспортных ограничений США Anthropic вернула флагманскую модель Fable 5. Компания внедрила новый классификатор безопасности, блокирующий 99% обходов, и предложила отраслевую шкалу оценки уязвимос
-
GPT-5.6: Мощь, но нет доступа. OpenAI меняет правила игры
OpenAI представила линейку GPT-5.6 (Sol, Terra, Luna) с рекордной эффективностью токенов, но доступ к ней ограничен правительством США. Разбираем цены, бенчмарки и стратегию «агентного» ИИ.
-
Anthropic вернула Fable 5: детали, цены и новые фильтры безопасности
После двухнедельного запрета на экспорт Anthropic возобновляет доступ к модели Fable 5. Разбираем, как изменились правила использования, цены и почему модель теперь блокирует больше легитимных запросов.