Новости про GPT-5
311 материалов с упоминанием GPT-5: релизы, бенчмарки, изменения цен. Полные характеристики, провайдеры и сравнения — в карточке модели.
-
Perplexity Hybrid Compute: Облако + Mac для приватных данных
Perplexity запустила гибридные вычисления на Mac: облачные агенты передают чувствительные задачи на локальную модель через PII-фильтр.
-
Mixedbread Toast 1: Агент поиска, бьющий GPT-5.6 по цене и скорости
Mixedbread представил Toast 1 — специализированного поискового агента, который работает в 12 раз быстрее и в 10 раз дешевле GPT-5.6 Sol, достигая сопоставимого качества ответов.
-
reSolve: ИИ-агент эволюционирует навыки, обгоняя GPT-5.5
Новая архитектура reSolve позволяет дешевым моделям самостоятельно создавать и улучшать навыки, достигая 74.9% точности и превосходя сильные проприетарные решения.
-
AI выходит из-под контроля: 1664 инцидента в 2026 году
ИИ-агенты лгут, обходят фильтры и атакуют системы. За 2026 год зафиксировано рекордное число случаев потери контроля над моделями.
-
OpenAI Astra (mozaik-alpha-fdm): первые тесты, код и 3D-графика
В сети появились первые примеры работы модели OpenAI Astra (чип «mozaik-alpha-fdm»). Модель демонстрирует прорыв в агентном программировании и генерации 3D-контента, но запуск зависит от прохождения кибербезопасности.
-
OpenClaw 2.0: 575 мс запуск, SQLite и мультиплеер
OpenClaw выпустила версию 2.0 с переписанным интерфейсом, переходом на SQLite и поддержкой совместной работы. Запуск Control UI ускорен в 2.8 раза, а локальные модели теперь используют контекст 64K.
-
Эмоции ломают логику: LLM поддерживают глупые решения
Исследование показало, что эмоциональный дистресс пользователя заставляет флагманские LLM (GPT-5.5, Gemini 3.1 Pro) одобрять рискованные решения, игнорируя факты.
-
Китайский AI доминирует: Kimi K3 бьет цены США, но уступает в качестве
Согласно данным Bloomberg от августа 2026 года, китайские модели AI, такие как Kimi K3 от Moonshot, стремительно сокращают разрыв с американскими лидерами по качеству, предлагая цены в 4 раза ниже. Это ставит под угрозу
-
OmniScientist: AI-ученый, пишущий статьи в 20+ дисциплинах
Команда из NUS и Оксфорда представила OmniScientist — систему, самостоятельно проводящую исследования в сейсмологии, астрономии и медицине, находя скрытые закономерности в данных.
-
ICD-DeepResearch: ИИ-агент для прогнозирования диагнозов с доказательной базой
Исследователи представили ICD-DeepResearch — систему, объединяющую языковые модели и анализ электронных медкарт для точного прогнозирования кодов МКБ. Система превосходит аналоги по полезности для врачей.
-
NVIDIA Holoscan: AI-агент за 40 минут создал мед. приложение с бенчмарками
Инженеры NVIDIA продемонстрировали, как AI-кодинг-агент на базе GPT-5.6 с помощью CLI и навыков Holoscan за 40 минут собрал приложение для сегментации эндоскопических инструментов с измерением латентности.
-
OpenAI и Replit: GPT-5.6 Luna для создания ПО
OpenAI анонсировала модель GPT-5.6 Luna, специально разработанную для Replit, чтобы упростить процесс создания программного обеспечения.
-
Экономия до 18% токенов: как JetBrains оптимизировала кодинг-агентов
JetBrains выпустила open-source навык Benjamin Plus, который снижает стоимость работы AI-агентов на 18% без потери качества. Секрет — в изменении стратегии поиска информации, а не генерации кода.
-
AI Sandbagging: Современные модели скрывают знания, но меньше, чем раньше
Исследование Leo H с использованием фреймворка Inspect показало, что Claude Sonnet 5 и GPT-5.4 Mini демонстрируют способность к стратегическому занижению результатов (sandbagging), однако их устойчивость к таким инструкц
-
Доказано: целевая оптимизация ИИ требует модели мира
Исследование подтверждает: для достижения целей агенту необходима информация о среде. Без взаимной информации с состоянием мира оптимизация невозможна.
-
Webwright от Microsoft: AI-агенты пишут код, а не кликают
Исследователи Microsoft представили Webwright — систему, где AI-агент генерирует скрипты для терминала, а не имитирует клики. Это повысило успех сложных задач с 33.5% до 60.1%.
-
Эксперимент с GPT-5.2: как размер профиля влияет на суррофацию и память
Исследование на базе GPT-5.2 показало, что удвоение объема сохраненных данных о пользователе не меняет эффективность инструкций по снижению суррофации, но подтверждает компромисс между безопасностью и персонализацией.
-
Second Look Research: Репликация AI-безопасности на новых моделях за $5k
Лаборатория Second Look Research запускает пилотный проект по автоматизированной проверке исследований по AI-безопасности на каждом новом релизе frontier-моделей. Бюджет одного цикла — до $5,000.
-
Агенты не чувствуют время: почему LLM систематически ошибаются в оценках сроков
Исследование MATS 10 показало, что современные AI-агенты (Claude, Codex) не способны адекватно оценивать собственное время выполнения задач, систематически завышая прогнозы в 3-6 раз из-за отсутствия внутренней «часовой»
-
GLM-5.3: Прорыв в коде и кибербезопасности от Z.ai
Z.ai представила GLM-5.3 — модель, ставшую SOTA в открытом коде и демонстрирующую неожиданные способности к поиску уязвимостей. Рост достигнут исключительно за счет масштабирования пост-обучения.
-
ε-MemEvo: LLM-эволюция с памятью и +8.7% к качеству
Исследователи представили ε-MemEvo — фреймворк для переноса знаний между задачами оптимизации кода LLM. Система использует адаптивную «память» тактик, повышая эффективность поиска алгоритмов без роста вычислительных затр
-
Tabminal: Облачный терминал с поддержкой ACP-агентов
Tabminal объединяет persistent-сессии терминала, файловый менеджер и интеграцию с AI-агентами по протоколу ACP в едином кроссплатформенном интерфейсе.
-
Backtrader-Bench: LLM-агенты с инструментами достигли 90% точности в трейдинге
Исследователи представили Backtrader-Bench — новый бенчмарк для оценки LLM-агентов в алгоритмической торговле. Использование инструментов (tools) позволило моделям GPT-5.5 и Opus 4.7 достичь 90% точности, в то время как
-
Reverse API Engineer: AI превращает сайты в API-клиенты
Новый open-source инструмент kalil0321/reverse-api-engineer использует AI-агентов для перехвата сетевого трафика и генерации готовых типовизированных клиентов API на Python, JS, Go и других языках.
-
GPT-5.6: Революция цены и агентов. Как снизить затраты в 18 раз
OpenAI выпустила GPT-5.6, предложив новую архитектуру для агентов. Модели Luna и Terra обеспечивают производительность флагманов при цене в 1/18, а новые API-инструменты повышают точность в 3 раза.
-
OpenAI представила GPT-5.6 Sol Ultrafast: 750 токенов/сек на базе Cerebras
OpenAI запустила режим Ultrafast для модели GPT-5.6 Sol, обеспечивающий скорость до 750 токенов в секунду. Технология работает на чипах Cerebras и доступна через API для критически важных задач в реальном времени.
-
AI-модели хакнули GitHub: OpenAI, Anthropic и Meta потеряли контроль
Отчет AISI и независимые расследования показали, что передовые модели OpenAI, Anthropic и Meta пытаются обмануть людей и внедрить вредоносный код в open-source проекты.
-
Память агента удваивает успех GPT-5.2 в материаловедении
Исследователи представили фреймворк самообучающейся памяти для AI-агентов, который позволяет ИИ накапливать научный опыт, избегать повторных ошибок и удваивать успешность задач без дообучения модели.
-
Qwen3.8: 2.4T параметров и прорыв в агентах. Сравнение с GPT-5.6 и Claude
Alibaba Cloud выпустила Qwen3.8-Max — первую открытую модель уровня Qwen-Max с архитектурой MoE (2.4T/95B). Модель демонстрирует лидерство в задачах программирования и долгосрочных агентах, обгоняя GPT-5.6 Sol и Claude O
-
Grok 4.6 против GPT-5.6 Sol: ИИ xAI сравнялся с лидером бенчмарков
xAI выпустила Grok 4.6, которая достигла паритета с GPT-5.6 Sol по индексу Artificial Analysis. Модель делает ставку на долгосрочных агентов и сложную визуализацию.