Новости про GPT-5
311 материалов с упоминанием GPT-5: релизы, бенчмарки, изменения цен. Полные характеристики, провайдеры и сравнения — в карточке модели.
-
Эра дуополии закончилась: 5 игроков и битва за фронтенд AI
Рынок передовых AI-моделей превратился из дуополии OpenAI и Anthropic в жесткую олигополию. Запуск Grok 4.5 от SpaceX и Muse Spark 1.1 от Meta изменил правила игры, а цены на вычислительные мощности достигли абсурдных вы
-
Эволюция агентов: почему автоматическая настройка промптов проигрывает простому масштабированию
Исследование из arXiv показывает, что сложные методы автоматической эволюции «упряжи» (harness) для LLM-агентов часто уступают простым методам тестового масштабирования и плохо обобщаются на новые задачи.
-
Квантование Qwen3.6-27B на M5 Max: 90% точность, но нулевая стат. значимость
Исследование Thanh Luong Tuana демонстрирует, что Qwen3.6-27B, обученный на одном Apple M5 Max, достигает уровня GPT-5 в вьетнамском финтехе, но статистически не превосходит его.
-
Mistral Vibe for Code победил Claude и Cursor в тесте на автономную разработку
В независимом сравнении четырех AI-агентов Mistral Vibe for Code занял первое место по совокупности характеристик, предложив лучший баланс цены, открытости и функциональности для сложных инженерных задач.
-
NVIDIA NeMo + Codex: Автономный RL-исследования с ростом точности до 96.9%
NVIDIA демонстрирует, как связка NeMo RL, NeMo Gym и агента Codex (GPT-5.5) автоматизирует полный цикл RL-исследований, включая создание сред и обучение моделей.
-
GPT-5-mini vs GPT-4.1-mini: Почему промпты работают по-разному
Исследование ICLR 2026 показало, что архитектурные различия между моделями OpenAI критически влияют на эффективность методов рассуждения. То, что помогает одной модели, может сломать другую.
-
OpenAI GPT-5.6: Sol, Terra, Luna — цены, бенчмарки и роль «рабочей лошадки»
OpenAI представила линейку GPT-5.6: флагман Sol, бюджетные Terra и Luna. Sol позиционируется как агент-исполнитель, превосходящий конкурентов в коде, но уступающий Fable в сложных рассуждениях.
-
MIT представила SceneSmith: AI-агенты создают 3D-сцены для обучения роботов
Исследователи MIT CSAIL и Toyota Research Institute разработали систему SceneSmith, использующую три AI-агента на базе GPT-5.2 для генерации фотореалистичных виртуальных сред. Это позволяет роботам тренироваться в тысяча
-
TRACE от Stanford: как агенты учатся на своих ошибках
Исследователи из Стэнфорда представили TRACE — систему, которая превращает повторяющиеся провалы AI-агентов в целевые тренировочные среды, повышая точность на 15+ пунктов.
-
UniVR: ИИ, мыслящий в визуальном пространстве, а не в тексте
ByteDance и Бэйханский университет представили UniVR — модель, обучающуюся визуальному рассуждению напрямую из пикселей, обходя текстовые абстракции.
-
GPT-5.6 Sol Ultra доказала 50-летнюю гипотезу графов: детали и риски
OpenAI объявила, что флагманская модель GPT-5.6 Sol Ultra нашла доказательство гипотезы о двойном покрытии циклов за час. Пока верификация не завершена, но подход с 64 агентами уже меняет правила игры.
-
NeuroVFM: 5.24 млн снимков и 92.6% точности в триаж
Университет Мичигана представил NeuroVFM — фундаментальную модель для нейровизуализации, обученную на 5.24 млн клинических МРТ и КТ. Модель превосходит GPT-5 в триаже и работает в 24 раза дешевле.
-
AegisDx: AI-фреймворк для безопасной дифференциальной диагностики
Исследователи представили AegisDx — систему на базе GPT-oss-120B, которая использует гипотетико-дедуктивный метод для выявления опасных заболеваний, превосходя стандартные LLM по точности и безопасности.
-
OpenAI подтвердил: GPT-5.6 — основной движок Copilot 365
Несмотря на слухи о возможном разрыве партнерства, OpenAI официально заявила, что новая модель GPT-5.6 станет предпочтительным ИИ для Microsoft Copilot 365.
-
OpenAI выпустила GPT-5.6: три модели, новый API и битва с Claude
OpenAI вывела в GA семейство GPT-5.6 (Sol, Terra, Luna). Флагман Sol лидирует в задачах кодинга, но уступает Claude в SWE-Bench Pro. Введен Programmatic Tool Calling и новая система кэширования.
-
Meta Muse Spark 1.1: Агенты, 1M контекст и API для конкурентов
Meta Superintelligence Labs выпустила закрытую модель Muse Spark 1.1 с упором на агентные задачи. Это первый платный API Meta для флагманских моделей, совместимый с OpenAI SDK.
-
OpenAI представила GPT-5.6: прямой вызов Anthropic в скорости, цене и агентах
OpenAI выпустила модель GPT-5.6 Sol, которая бьет Claude Fable 5 по скорости и стоимости, а также анонсировала ChatGPT Work — конкурента Claude Cowork для автоматизации офисных задач.
-
GPT-5.6 стал основным ИИ в Microsoft 365 Copilot
OpenAI объявила о внедрении флагманской модели GPT-5.6 в экосистему Microsoft 365. Обновление повышает эффективность работы в Word, Excel, PowerPoint и Cowork за счет оптимизации использования токенов и улучшения качеств
-
OpenAI: Капитал фонда $130 млрд и релиз GPT-5.6
OpenAI Foundation достигла исторического капитала в $130 млрд, а коммерческая структура перешла в статус общественно-полезной корпорации. Параллельно анонсирован релиз GPT-5.6 и новые голосовые возможности ChatGPT.
-
GPT-5.6, Claude Fable 5 и эра FDE: Итоги AI Engineer World's Fair
OpenAI анонсировала публичный релиз GPT-5.6, а на AI Engineer World's Fair в Сан-Франциско доминировала тема агентных циклов и роли forward-deployed инженеров.
-
OpenAI удвоила награду за взлом GPT-5.5/5.6 до $50k
OpenAI трансформировала разовый конкурс в постоянную программу Bio Bounty, увеличив вознаграждение за универсальные обходы биобезопасности с $25 000 до $50 000.
-
OpenAI представила GPT-5.6 и ChatGPT Work: автономные агенты для бизнеса
OpenAI выпустила модель GPT-5.6 и новый режим ChatGPT Work, позволяющий ИИ самостоятельно выполнять сложные рабочие задачи, интегрироваться с корпоративными приложениями и работать над проектами часами без участия челове
-
OpenAI представила GPT-5.6: Sol, Terra и Luna с рекордной эффективностью
OpenAI вывела на рынок семейство моделей GPT-5.6. Флагман Sol бьет рекорды в коде и науке, а новые модели Terra и Luna предлагают производительность уровня прошлых флагманов при стоимости в 1/16.
-
SageMath + LLM: Прорыв в математике с приростом точности до 27.8%
Исследование показывает, что интеграция системы компьютерной алгебры SageMath в агентов на базе LLM дает прирост точности до 27.8% на сложных задачах. GPT-5.5 достигла 75.2% решения, а разрыв между открытыми и закрытыми
-
SpaceXAI выпустила Grok 4.5: 4.2x эффективнее Opus 4.8 за $2/млн токенов
SpaceXAI представила Grok 4.5 — модель для кодинга и агентов, обученную совместно с Cursor. Новинка бьет рекорды по эффективности токенов и стоит дешевле конкурентов.
-
xAI представила Grok 4.5: лидер в коде, скорость 80 TPS и цена $2/млн токенов
SpaceXAI выпустила Grok 4.5 — первую модель, заточенную под агентов и разработку. Она обходит конкурентов в бенчмарках SWE Bench, работает в 4.2 раза эффективнее по токенам и стоит дешевле аналогов.
-
Cursor и SpaceXAI выпустили Grok 4.5: новый флагман для сложных задач
Cursor совместно с SpaceXAI представил Grok 4.5 — первую модель, обученную не только для кода, но и для широкого спектра интеллектуальных задач. Флагман уровня Opus доступен в Cursor с удвоенным лимитом на первую неделю.
-
OpenAI представила GPT-Live: голосовые модели с full-duplex и делегированием GPT-5.5
OpenAI выпустила GPT-Live и GPT-Live-1 mini для ChatGPT. Новые модели поддерживают одновременное слушание и говорение, а сложные задачи делегируют фоновой модели GPT-5.5.
-
Agent Arena: Claude Opus 4.7 (Thinking) и GPT 5.5 лидируют в реальном тесте
Arena.ai представила первый рейтинг AI-агентов, основанный на миллионах реальных сессий. Методология «causal tracing» выявила, что Claude Opus 4.7 (Thinking) и GPT 5.5 (High) показывают наилучший баланс эффективности и с
-
Microsoft представила Flint: язык визуализации для AI-агентов
Исследователи Microsoft создали промежуточный язык Flint, позволяющий LLM-агентам генерировать сложные графики из простых спецификаций с точностью выше, чем прямая генерация кода.