Новости про GPT-5
18 материалов с упоминанием GPT-5: релизы, бенчмарки, изменения цен. Полные характеристики, провайдеры и сравнения — в карточке модели.
-
Cognition SWE-2: 50% на FrontierCode и на 64% дешевле конкурентов
Cognition представила SWE-2 — самую мощную модель для программирования, которая обходит Grok 4.6 и GPT-5.6 Sol по соотношению цена/качество, используя RL-обучение на триллионных параметрах.
-
ORQA: Тест на профпригодность ИИ. Кто лучший в медицине, а кто провалил стройку?
Исследователи представили ORQA — первый масштабный бенчмарк, оценивающий профессиональные знания LLM по реальным должностям. Топ-модели набрали лишь 60%, а некоторые профессии для ИИ остаются «слепыми зонами».
-
Мультиязычие лишь на бумаге: LLM провалили тест на урду
Исследование выявило критические языковые и культурные ошибки в текстах GPT-5.1, Qwen-3-Max и DeepSeek-3.1, сгенерированных на урду.
-
ByteDance: LLM-агенты пишут код, но 66% изменений не работают
Исследование HarnessDev показало, что LLM могут создавать собственные среды выполнения (harness), но их способность к самооптимизации ограничена: лишь 34 из 64 изменений обобщаются на новые задачи.
-
Plexe: Автономное создание ML-моделей через естественный язык
Новый open-source фреймворк Plexe использует мультиагентную архитектуру для автоматической разработки, обучения и упаковки моделей машинного обучения по текстовому описанию.
-
AIRO: LLM-прогнозы катастроф. GPT-6 и Opus 5 оценивают риск гибели 10% человечества
Институт прогнозирования (FRI) запустил AIRO — автоматизированную систему, где топовые LLM оценивают вероятность катастроф. К 2030 году риск оценивается в 0,47%, к 2050 — в 6%.
-
CoTControl: Почему оценки контроля цепочки рассуждений (CoT) завышены
Исследование показывает, что базовые промпты сильно занижают способность моделей управлять своими внутренними рассуждениями. Оптимизация инструкций увеличивает показатели compliance в 2-3 раза, что критично для безопасно
-
BoardUI: React-компоненты для AI-агентов с поддержкой MCP
Платформа BoardUI предлагает 62 бесплатных React-компонента для создания интерфейсов AI-агентов. Ключевая фишка — нативная поддержка MCP-серверов для установки через CLI и интеграция с 7+ провайдерами LLM.
-
Sakana AI: Fugu Max и Ultra v2 — новый стандарт мультиагентной оркестрации
Sakana AI представила модели Fugu Max и Fugu Ultra v2, которые предлагают маршрутизацию запросов между пулом других ИИ-моделей. Это решение снижает затраты до 60% и повышает качество сложных задач, избегая зависимости от
-
Cohere выпустила North Small Translate: 218B MoE, бьющая Google Translate
Cohere Labs представила модель машинного перевода North Small Translate (218B параметров, 25B активных), которая набирает 83.6 балла на WMT26, превосходя DeepL и Google Translate.
-
ToolGrad от Google: 99.8% успеха в генерации данных для вызова инструментов
Исследователи Google представили ToolGrad — фреймворк, инвертирующий процесс создания датасетов для LLM. Генерация проверенных цепочек вызовов API достигла 99.8% эффективности, а модель Gemma-3-12B, обученная на 500 прим
-
OpenDiscoveryTrace: Почему GPT-5.4 надежнее Claude Opus 4.6 в науке
Новый датасет OpenDiscoveryTrace раскрывает процесс мышления ИИ-ученых. Анализ 558 траекторий показал, что при схожей успешности GPT-5.4 совершает в 30 раз меньше ошибок инструментов, чем Claude Opus 4.6.
-
Правильный ответ ≠ Правильное решение: тест AI-мониторов на физике
Исследование показало, что AI-мониторы легко находят ошибки, когда видят верный ответ, но терпят неудачу в поиске логических дыр в рассуждениях, даже если итоговый результат верен.
-
Astra: модель мыслит скрытно. Как «мусорные» токены раскрывают истинный интеллект
Исследование GPT-6-Astra показало: добавление бессмысленных токенов в промпт резко повышает её способность к рассуждению. Это ставит под угрозу существующие методы безопасности ИИ.
-
Benchmark MessageBoardAuditBench: Насколько ИИ-расследователи эффективны?
Исследователи из LessWrong представили MessageBoardAuditBench для оценки способности агентов расследовать инциденты с коллаборацией AI. Топовые модели выявляют лишь до 51% ключевых выводов.
-
GPT-5.6 Sol автономно калибрует кубиты: кейс MIT
Исследовательница MIT Beatriz Yankelevich использовала GPT-5.6 Sol через Codex для автоматизации калибровки сверхпроводящих чипов, сократив время рутинных измерений и освободив ученых для анализа данных.
-
OpenAI представила GPT-6 Astra: прорыв в AI и компьютерном использовании
OpenAI анонсировала GPT-6 Astra, заявляя о ней как о самой интеллектуальной и выровненной модели. Новинка демонстрирует рекордные результаты в математике, программировании и автономном управлении компьютером.
-
OpenWhispr: приватная диктовка и AI-агенты с локальным Whisper
Open-source альтернатива WisprFlow: голос в текст, транскрибация встреч и AI-агенты с полной приватностью. Поддержка macOS, Windows, Linux.