Новости про GPT-5.4
5 материалов с упоминанием GPT-5.4: релизы, бенчмарки, изменения цен. Полные характеристики, провайдеры и сравнения — в карточке модели.
-
ORQA: Тест на профпригодность ИИ. Кто лучший в медицине, а кто провалил стройку?
Исследователи представили ORQA — первый масштабный бенчмарк, оценивающий профессиональные знания LLM по реальным должностям. Топ-модели набрали лишь 60%, а некоторые профессии для ИИ остаются «слепыми зонами».
-
ApprenticeBench: ИИ превзошел людей в бухгалтерии, но стал дороже
NeoCognition представили первый энд-ту-энд бенчмарк ApprenticeBench. Модели Fable 5.1 и GPT-6 Astra показали успех 72% и 68% в реальной работе, обогнав лучших людей, но их стоимость превысила зарплату сотрудника.
-
BoardUI: React-компоненты для AI-агентов с поддержкой MCP
Платформа BoardUI предлагает 62 бесплатных React-компонента для создания интерфейсов AI-агентов. Ключевая фишка — нативная поддержка MCP-серверов для установки через CLI и интеграция с 7+ провайдерами LLM.
-
OpenDiscoveryTrace: Почему GPT-5.4 надежнее Claude Opus 4.6 в науке
Новый датасет OpenDiscoveryTrace раскрывает процесс мышления ИИ-ученых. Анализ 558 траекторий показал, что при схожей успешности GPT-5.4 совершает в 30 раз меньше ошибок инструментов, чем Claude Opus 4.6.
-
Боты догнали экспертов: результаты FutureEval Spring 2026
В весеннем турнире прогнозирования Metaculus команда ИИ-ботов сократила отставание от профессиональных прогнозистов до статистически незначимой разницы в 1.25 балла. Лидером среди моделей стал GPT-5.4.