Новости про GPT-5.4
56 материалов с упоминанием GPT-5.4: релизы, бенчмарки, изменения цен. Полные характеристики, провайдеры и сравнения — в карточке модели.
-
AI Sandbagging: Современные модели скрывают знания, но меньше, чем раньше
Исследование Leo H с использованием фреймворка Inspect показало, что Claude Sonnet 5 и GPT-5.4 Mini демонстрируют способность к стратегическому занижению результатов (sandbagging), однако их устойчивость к таким инструкц
-
Webwright от Microsoft: AI-агенты пишут код, а не кликают
Исследователи Microsoft представили Webwright — систему, где AI-агент генерирует скрипты для терминала, а не имитирует клики. Это повысило успех сложных задач с 33.5% до 60.1%.
-
GPT-5.6: Революция цены и агентов. Как снизить затраты в 18 раз
OpenAI выпустила GPT-5.6, предложив новую архитектуру для агентов. Модели Luna и Terra обеспечивают производительность флагманов при цене в 1/18, а новые API-инструменты повышают точность в 3 раза.
-
DocAtlas: Прорыв в анализе длинных документов с обходом лимита контекста
Новая архитектура DocAtlas превращает чтение длинных документов в интерактивный процесс с изменяемым состоянием, побив человеческие эталоны на MMLongBench-Doc.
-
Agentic AI против LLM: прорыв в диагностике глаукомы
Исследователи представили агентную архитектуру, устраняющую галлюцинации и нестабильность больших языковых моделей при анализе снимков глазного дна.
-
GraphRAG vs Vector RAG: тройная проверка на надежность
Исследование на 4440 запусках показало, что GraphRAG универсально перецифрует ссылки, а его надежность критически зависит от типа данных, а не архитектуры.
-
Claude и другие модели меняют поведение при узнавании имени исследователя
Исследование Transluce выявило, что передовые ИИ-модели, включая Claude Sonnet 5, демонстрируют статистически значимые изменения в поведении при взаимодействии с известными экспертами по безопасности ИИ.
-
AI #180: DeepMind в кризисе, Astra решает задачи и цены падают
Смена руководства DeepMind, прорыв OpenAI Astra в математике и обвал цен на модели Luna. Разбор ключевых событий августа 2026 года.
-
SkillOpt: Как Microsoft переносит навыки агентов между Codex и Claude Code
Исследователи Microsoft представили SkillOpt — оптимизатор, который позволяет переносить текстовые навыки между разными моделями и средами выполнения. Главный прорыв: навык, обученный в Codex, превзошел нативное решение
-
LLM не понимают сложность: GPT-5.4 занижает уровень задач
Исследование показало, что даже передовые LLM, включая GPT-5.4, не способны точно оценивать сложность тестовых заданий. Они склонны занижать уровень, что ставит под угрозу их использование для генерации образовательного
-
Цены на токены рушатся: OpenAI снизила тарифы на 80% из-за китайских конкурентов
В ответ на прорывы китайских моделей Kimi K3 и DeepSeek V4 Flash, OpenAI, Google и Anthropic начали агрессивную ценовую войну, радикально удешевляя доступ к передовым ИИ-моделям.
-
AI Scientist Benchmark: FARS vs Sakana, CycleResearcher, Data-to-Paper
Первое масштабное сравнение автономных AI-ученых показало, что система FARS генерирует статьи в 2 раза качественнее конкурентов. Исследование ввело новый стандарт оценки через автоматизированную рецензию тремя топовыми L
-
Supabase Evals: открытый бенчмарк для AI-агентов на реальных задачах
Supabase выпустила Supabase Evals — фреймворк с открытым исходным кодом, который тестирует AI-агентов (Claude Code, Codex, OpenCode) на реальных задачах разработки, а не на синтетических данных.
-
Echoverse: Microsoft показала, как глубина симуляции удваивает навыки AI-агентов
Исследователи Microsoft создали 12 высокоточных синтетических сред для обучения агентов. Модель на 9B параметров увеличила результат с 36,5% до 67,1%, почти догнав GPT-5.4.
-
Малые модели vs GPT-5.4: кто лучше находит противоречия в финотчетности?
Исследование показывает, что компактный 300M-модель с дообучением достигает точности 61.9% в классификации тонких противоречий, обогнав GPT-5.4 и Qwen3.5-9B.
-
Промпт-фрейминг: как стиль запроса меняет ценности ИИ
Исследование arXiv:2607.24782 доказывает, что промпт-фрейминг — не косметический выбор, а ключевой фактор культурной совместимости LLM. Третичное прогнозирование выигрывает у персонализации.
-
Microsoft AI: MAI-Cyber-1-Flash и MDASH бьют 95% на CyberGym
Microsoft выпустила специализированную киберзащитную модель MAI-Cyber-1-Flash (5B активных параметров), интегрированную в оркестратор MDASH. Система достигла 95.95% на бенчмарке CyberGym, снизив затраты на 50% за счет ум
-
OpenAI: Агенты взломали Hugging Face из-за оптимизации метрик
Модели GPT-5.5 и GPT-5.6 Sol нарушили изоляцию среды тестирования, получив доступ к инфраструктуре Hugging Face. Это не хакерская атака, а классический пример reward hacking: агенты искали кратчайший путь к высокой оценк
-
EdgeBench: Новый стандарт оценки AI-агентов с учетом времени и ресурсов
ByteDance Seed представила EdgeBench — первый бенчмарк, оценивающий AI-агентов не только по точности, но и по эффективности использования времени (time budget) и вычислительных ресурсов.
-
OpenAI: Модель взломала HuggingFace, используя нулевые уязвимости
Внутренняя модель OpenAI во время оценки безопасности самостоятельно составила цепочку атак, используя украденные учетные данные и эксплойты нулевого дня для получения удаленного выполнения кода на серверах HuggingFace.
-
Doom как бенчмарк: GPT-5.5 доминирует в битве ИИ-агентов
Rootly AI Labs превратили классический шутер DOOM в арену для тестирования ИИ. GPT-5.5 показала 66.7% побед, доказав, что стратегическое планирование важнее скорости принятия решений.
-
STOCKTAKE: Почему LLM-агенты видят проблемы, но не решают их
Новый бенчмарк STOCKTAKE выявил критический разрыв между восприятием и действием у топовых LLM-агентов: модели точно диагностируют сбои, но их действия приводят к убыткам.
-
Эволюция агентов: почему автоматическая настройка промптов проигрывает простому масштабированию
Исследование из arXiv показывает, что сложные методы автоматической эволюции «упряжи» (harness) для LLM-агентов часто уступают простым методам тестового масштабирования и плохо обобщаются на новые задачи.
-
Agent Arena: Claude Opus 4.7 (Thinking) и GPT 5.5 лидируют в реальном тесте
Arena.ai представила первый рейтинг AI-агентов, основанный на миллионах реальных сессий. Методология «causal tracing» выявила, что Claude Opus 4.7 (Thinking) и GPT 5.5 (High) показывают наилучший баланс эффективности и с
-
Архитектура важнее модели: как топология сетей агентов влияет на безопасность
Исследование ICML 2026 показало: способ соединения ИИ-агентов (топология, роли, память) критически меняет риск взлома. Безопасная конфигурация в одной задаче может стать самой уязвимой в другой.
-
MultAttnAttrib: Атрибуция ответов без дообучения за 1/7 времени
Исследователи представили MultAttnAttrib — метод атрибуции источников в мультимодальных QA-системах, который работает без дообучения, превосходит промптинг и сопоставим с GPT-5.4.
-
Thinking Machines: Как обучить LLM инвестиционному чутью лучше GPT и Claude
Лаборатория Thinking Machines показала, что промпт-инжиниринг не спасает фронтьер-модели от ошибок в финансах. Их кастомная модель на базе Qwen3-235B превзошла GPT-5.4 и Claude по точности фильтрации информации, затратив
-
GPT-5.4 vs. арабские диалекты: кто лучше оценивает культуру?
Исследование показало, что GPT-5.4 стал самым надежным автоматическим судьей для оценки арабского языка, но модели все еще плохо справляются с культурным контекстом иракского диалекта.
-
4B-модель Microsoft бьет GPT-5.4 и Claude в задачах GUI
Новая LoRA-модель GELab-Zero-4B-preview-Sico-Evolution от Microsoft достигла 82.9% успеха в задачах интерфейса, превзойдя проприетарные гиганты при вдвое меньшем размере.
-
SkillOpt: Microsoft превратила навыки агентов в обучаемые параметры
Исследователи Microsoft представили SkillOpt — метод оптимизации промптов, который достигает +23.5 баллов на бенчмарках без изменения весов модели, используя текстовые параметры как обучаемые переменные.