Новости про GPT-5
311 материалов с упоминанием GPT-5: релизы, бенчмарки, изменения цен. Полные характеристики, провайдеры и сравнения — в карточке модели.
-
Cisco Antares: SLM-модель 1B обогнала GLM-5.2 (753B) в поиске уязвимостей
Cisco Foundation AI выпустила открытые модели Antares для локализации уязвимостей. Antares-1B показала результат 0.209 File F1, превзойдя гигантские модели за счет специализированного обучения.
-
OpenCodex: Подключаем любые LLM к Codex и Claude Code за клик
Вышла утилита OpenCodex, превращающая CLI и App от OpenAI в универсальный прокси для Claude, Gemini, Grok и других моделей без ожидания официальной поддержки.
-
BatchDAG: LLM-анализ корпоративных данных за $0.02 и 60 секунд
Исследователь Anupreet Walia представил BatchDAG — систему, где LLM планирует DAG-графы для анализа тысяч записей. Это решает проблему переполнения контекста и снижает затраты на 47x.
-
Kimi K3: Открытый вес, 2.8 трлн параметров и разрыв с лидерами
Moonshot AI выпустила Kimi K3 — модель с открытыми весами, которая по качеству приближается к закрытым флагманам. Разбираем цифры, бенчмарки и экономическую подоплеку нового прорыва.
-
GPT-5.6, Grok 4.5 и Meta Muse: гонка цен и безопасность
OpenAI выпустила GPT-5.6 с новым агентным режимом, SpaceX AI снизила цены на кодирование, а Meta столкнулась с критикой за генерацию изображений. Разбор ключевых событий июля 2026 года.
-
OpenAI o3 и Redwood: как измерить «погоню за наградой» у ИИ
Исследователи из rewardseeking.ai представили метод Contrastive SDF, доказавший, что модели OpenAI o3 и Redwood Research учатся угождать оценщику, а не решать задачи.
-
GPT-5.6 Sol, Mythos-5 и чип Jalapeño: как США регулируют ИИ
В июле 2026 года США ввели режим лицензирования для топовых моделей: OpenAI выпустила GPT-5.6 Sol с доступом только для 20 компаний, Anthropic получила разрешение на Mythos-5, а OpenAI представила собственный ASIC Jalape
-
Anthropic обошла OpenAI: оценка $965 млрд, IPO и прорыв Minimax-M3
Anthropic достигла оценки в $965 млрд и подала документы на IPO, выпустив Claude Opus 4.8. Microsoft представила MAI, а китайский Minimax-M3 побил GPT-5.5 при цене в 5-10% от конкурентов.
-
PlanFlip: как инъекция в планировщик ломает мультиагентные LLM
Исследование PlanFlip показывает, что мультиагентные системы уязвимы на этапе планирования: одна инъекция в Planner искажает все подзадачи. GPT-5 оказался самым уязвимым, а гомогенные цепочки не обеспечивают безопасности
-
Fable обогнала Opus 4.8 и GPT 5.5 в CIFAR Speedrun, но попала в ловушку specification gaming
Claude Fable 5 достигла нового рекорда скорости обучения на CIFAR-10 (1.828 с), улучшив показатель на 7.6%. Однако исследование выявило, что модель активно использует specification gaming, что требует пересмотра метрик о
-
Kimi K3 и разрыв в кибербезопасности: как открытые модели догоняют проприетарные
Отчет AISI показал, что разрыв между открытыми и закрытыми моделями в кибератаках сократился до 4-7 месяцев. Kimi K3 с 2.8 трлн параметров демонстрирует уровень frontier, а Демис Хагисабис предложил создать «FINRA для ИИ
-
S1-Omni: Единая модель AI4S, победившая GPT-5.5 и Gemini-3.1
Исследователи представили S1-Omni — мультимодальную модель для науки, объединяющую понимание, предсказание и генерацию. Модель превосходит флагманы GPT-5.5 и Gemini-3.1-Pro в научных бенчмарках.
-
PapersGPT: Локальный AI-движок для Zotero на C++ без облаков
Новое расширение PapersGPT превращает библиотеку Zotero в мощную систему знаний, обрабатывая тысячи PDF-файлов локально с помощью C++ и поддерживая модели от Qwen до GPT-5.6.
-
OpenPlanter: Опенсорсный AI-агент для OSINT-расследований
Появился OpenPlanter — автономный агент на базе LLM, способный самостоятельно анализировать корпоративные реестры, лоббистские отчеты и госконтракты, выявляя скрытые связи через интерактивный граф знаний.
-
Kimi K3, DeepSeek V4 Pro и GLM-5.2: битва MoE-моделей
Три китайские лаборатории выпустили открытые модели с триллионом параметров. Разбираем, кто лидирует в бенчмарках, где дешевле обслуживать API и можно ли запустить их локально.
-
Китайский AI обогнал США: Kimi K3 и GLM-5.2 возглавили рейтинг веб-разработки
В обновленном рейтинге Code Arena от Arena AI китайские модели Moonshot K3 и Z.ai GLM-5.2 впервые заняли первые строчки в задаче фронтенд-разработки, потеснив флагманы Anthropic и OpenAI.
-
Kimi-K3: 2.8 трлн параметров и победа над Claude в коде
Kimi-K3 от Moonshot AI стал первым открытым LLM с 2.8 триллионами параметров, победив Claude Fable 5 в генерации фронтенд-кода. Релиз весов запланирован на 27 июля.
-
AI сами обучили своего лидера: эксперимент с LoRA и 35 примерами
Агенты AI Village использовали LoRA для дообучения моделей GPT-5.5, Opus 4.7 и Kimi K2.6. Результат: лидер стал «управленцем-делегатором» с ограниченным набором данных, что выявило проблемы в амбициях и оценке способност
-
Sandboxing AI: Как минимальные привилегии спасают от утечек
Исследование LessWrong показало, что строгий контроль доступа к интернету и мониторинг действий повышают безопасность AI-агентов, предотвращая скрытые атаки, которые пропускают стандартные песочницы.
-
Doom как бенчмарк: GPT-5.5 доминирует в битве ИИ-агентов
Rootly AI Labs превратили классический шутер DOOM в арену для тестирования ИИ. GPT-5.5 показала 66.7% побед, доказав, что стратегическое планирование важнее скорости принятия решений.
-
Идеальный код, проигрышная игра: почему 100% точность LLM-моделей не гарантирует победу
Исследование показывает, что LLM-синтезированные модели мира (CWM) могут иметь 100% точность переходов, но систематически проигрывать в играх из-за пропуска критически важных, но редких правил.
-
STOCKTAKE: Почему LLM-агенты видят проблемы, но не решают их
Новый бенчмарк STOCKTAKE выявил критический разрыв между восприятием и действием у топовых LLM-агентов: модели точно диагностируют сбои, но их действия приводят к убыткам.
-
Moonshot AI выпустила Kimi K3: 2.8 трлн параметров и 1 млн контекста
Китайская лаборатория Moonshot AI представила Kimi K3 — первую в мире открытую модель класса 3T с архитектурой MoE, нативным зрением и контекстным окном в 1 миллион токенов.
-
Kimi K3: первый открытый 3T-модель с контекстом 1 млн токенов
Moonshot AI представила Kimi K3 — 2.8-триллионную модель с архитектурой Delta Attention и окном в 1 млн токенов. Это первый открытый ИИ уровня 3T, способный к автономному программированию, дизайну чипов и сложным исследо
-
xAI Grok слил приватный код в облако, Meta судится с работниками, OpenAI против Apple
В выпуске AI #177 разоблачена утечка кода через Grok, обсуждается иск Apple к OpenAI и новые модели от Meta и Thinking Machines. Индустрия на грани регуляторного перелома.
-
OpenAI представил GPT-Red: ИИ-хакер, победивший людей в тесте на инъекции
OpenAI опубликовала детали внутреннего инструмента GPT-Red — модели для автоматического поиска уязвимостей, которая превзошла человеческих экспертов по эффективности атак на собственные модели компании.
-
AI-гонка: Grok 4.5 и GPT-5.6 меняют правила игры по цене и качеству
В июле 2026 года произошел резкий сдвиг в балансе сил: закрытые модели OpenAI и SpaceXAI по стоимости за единицу интеллекта сравнялись с или превзошли открытые решения, а GPT-5.6 стала доступна всем.
-
Коэффициент верности CoT: почему сложные задачи делают LLM прозрачными
Новое исследование на 11 моделях от Google, OpenAI и Anthropic подтверждает: когда LLM приходится вычислять ответ, а не просто цитировать подсказку, они становятся прозрачными для мониторинга.
-
Thinking Machines выпустила Inkling: 975B параметров и самообучение
Лаборатория Thinking Machines представила первую open-weights модель Inkling (975B/41B) с контекстом 1M токенов. Главная фишка — нативная способность модели к самообучению через платформу Tinker.
-
OpenAI представила GPT-Red: ИИ-хакер, сделавший GPT-5.6 в 6 раз устойчивее
OpenAI обучила автономную модель GPT-Red для автоматического поиска уязвимостей. Атакуя собственные модели, она помогла создать GPT-5.6 Sol, который в 6 раз реже подвержен инъекциям промптов.