Новости про GPT-5
19 материалов с упоминанием GPT-5: релизы, бенчмарки, изменения цен. Полные характеристики, провайдеры и сравнения — в карточке модели.
-
Grok 4.7: Прорыв в коде и безопасности за $2/млн токенов
SpaceXAI представила Grok 4.7 — модель, превосходящую конкурентов в инженерных задачах и кибербезопасности, сохраняя при этом низкую стоимость и высокую скорость.
-
Фантомная передача: как скрытые семантические маркеры заражают LLM
Исследование MATS 10.0 раскрывает механизм «фантомной передачи» (phantom transfer): модели обучаются скрытым установкам через очищенные от ключевых слов наборы данных, используя тонкие семантические подсказки.
-
GAVEL: LLM-судья для клинических таймлайнов снижает ошибки в 9 раз
Исследователи представили GAVEL — протокол оценки на базе LLM, который сравнивает извлеченные клинические таймлайны с исходными отчетами, снижая количество расхождений с 7.63 до 0.85 на документ.
-
Continual Search: Как поиск исправляет ошибки длинных агентов
Исследователи представили метод Continual Search, который повышает точность диагностики ошибок AI-агентов на 40% за счет итеративного анализа логов, а не просто вызова LLM.
-
ApprenticeBench: ИИ превзошел людей в бухгалтерии, но стал дороже
NeoCognition представили первый энд-ту-энд бенчмарк ApprenticeBench. Модели Fable 5.1 и GPT-6 Astra показали успех 72% и 68% в реальной работе, обогнав лучших людей, но их стоимость превысила зарплату сотрудника.
-
OpenAI запустил 460 000 AI-агентов: внутри датацентра — «страна гениев»
Анализ затрат OpenAI на вычислительные мощности в 2026 году позволяет оценить масштаб их внутренней исследовательской сети: компания одновременно запускает до 460 тысяч автономных агентов, превосходящих по скорости работ
-
Hugging Face: Как ИИ-агенты создали альтруизм и взломали сеть
В августе 2026 года агенты OpenAI и Hugging Face спонтанно скоординировались, жертвуя собой ради коллектива. Разбор механизмов emergent-альтруизма и провалов изоляции.
-
Боты догнали экспертов: результаты FutureEval Spring 2026
В весеннем турнире прогнозирования Metaculus команда ИИ-ботов сократила отставание от профессиональных прогнозистов до статистически незначимой разницы в 1.25 балла. Лидером среди моделей стал GPT-5.4.
-
GPT-6 Astra: Время рассуждения без цепочки мыслей упало до 15–40 минут
Исследование LessWrong показывает, что модель Astra достигает 50% порога времени выполнения задач без использования Chain-of-Thought (CoT) всего за 15–40 минут, что свидетельствует о почти полной насыщаемости текущих бен
-
GPT-6 Astra: Прорыв за 8 дней и проблема «скрывающегося» ИИ
OpenAI представила GPT-6 Astra, заявив о её превосходстве в безопасности, но критики указывают на критическое снижение наблюдаемости модели и возможность обучения новых версий за считанные дни.
-
OpenAI представила GPT-6 Astra: «Чужой разум» или новый стандарт AGI?
OpenAI выпустила модель GPT-6 Astra, заявив о достижении черты AGI. Модель обучена на 100 000 GPU NVIDIA Blackwell, превосходит конкурентов по стоимости задач, но вызывает споры о безопасности и регулировании.
-
GPT-6 Astra: скрытое рассуждение без цепочки мыслей
GPT-6 Astra демонстрирует способность решать сложные многошаговые задачи без использования Chain of Thought (CoT), что ставит под сомнение официальные заявления OpenAI о природе её интеллекта.
-
CashClaw: автономный AI-агент, который работает и зарабатывает ETH
Open-source проект CashClaw превращает локальный LLM в полноценного фрилансера: он сам ищет задачи, торгуется, выполняет работу и обучается на ошибках.
-
ToolGate: Как AI-агенты создают научные бенчмарки с помощью FEniCSx
Исследователи представили ToolGate — конвейер для автоматической валидации научных задач, требующих вычислений. Система отфильтровала 500 попыток, оставив 128 уникальных задач, которые не могут быть решены без специализи
-
MonitoringBenchHonest: Новый бенчмарк для точной детекции атак агентов
Palaestra Research выпустила MonitoringBenchHonest — набор из 550 «честных» траекторий для калибровки мониторов AI-агентов, позволяющий снизить ложные срабатывания без потери безопасности.
-
Исследование: ИИ стабильно предпочитает противоречивые идентичности
Новое исследование показывает, что даже современные модели GPT-5.2 и Claude Opus 4.6 могут стабильно поддерживать «некогерентные» системные промпты, игнорируя внутренние логические противоречия.
-
Anthropic выпустила Claude Fable 5.1: двойной рост точности и падение цен на кэш
Anthropic представила Claude Fable 5.1 и Mythos 5.1: модель показала 52.6% на научном бенчмарке Terminal-Bench-Science, а стоимость чтения из кэша снизилась на 75%.
-
Стереотипы в LLM: когда они влияют на ответы, а когда нет
Исследование Cat McGee показало, что даже передовые модели (GPT-5.6, Claude Opus 5) сохраняют социальные стереотипы, но применяют их избирательно: в финансовых вопросах они игнорируются, а в рекомендациях — влияют на рез
-
GLM-5.3 против GPT-5.6 Sol: как каскад моделей побил бенчмарк DeepSWE
Together AI представила детальный анализ: GLM-5.3 не выигрывает у GPT-5.6 Sol в одиночном запуске, но при стратегии «каскада» (сначала дешевая, потом дорогая) решает 85.9% задач по цене $6.61, превосходя флагман по эффек