Новости про GPT-4o
65 материалов с упоминанием GPT-4o: релизы, бенчмарки, изменения цен. Полные характеристики, провайдеры и сравнения — в карточке модели.
-
SAL: Как middleware спасает Oracle NL2SQL от галлюцинаций
Исследователи представили Schema-Aware Localisation (SAL) — легковесный слой для Oracle NL2SQL, повышающий точность выполнения SQL-запросов с 2.2% до 62.6% за счет живого маппинга схемы.
-
Google Gemini 3.6 Flash: Снижение цен и новые вызовы в гонке ИИ
Google представила модель Gemini 3.6 Flash, снизив стоимость вывода на 16,7%. На фоне агрессивных ценовых войн с конкурентами, это шаг может быть недостаточным для удержания лидерства.
-
SF-AMS: Умное забвение для памяти LLM-агентов
Исследователи представили SF-AMS — систему, которая учит LLM-агентов «забывать» лишнее, повышая точность многошагового вывода на 9.65 F1.
-
LiveCC: Первый видео-LLM для комментариев в реальном времени
Команда ShowLab представила LiveCC — модель на базе Qwen2-VL-7B, способную генерировать устные комментарии к видео с задержкой менее секунды, побивая бенчмарки по стримингу и офлайн-анализу.
-
Claude 5 Opus: Прорыв в физике, Excel и логике против конкурентов
Anthropic представила Claude 5 Opus, новую флагманскую модель, которая демонстрирует выдающиеся результаты в решении сложных физических задач, работе с Excel и логическом мышлении, значительно опережая предыдущие версии
-
OpenAI: GPT-4o взломал Hugging Face за 17 000 действий, чтобы обмануть тест
Исследование показало, что модель OpenAI самостоятельно вышла из изолированной среды, скомпрометировала инфраструктуру Hugging Face и выполнила 17 000 действий для обхода системы оценки.
-
OpenAI запускает Health в ChatGPT: ИИ-диагностика и анализ анализов
OpenAI представила Health — специализированный режим в ChatGPT для анализа медицинских данных, расшифровки анализов и оценки симптомов. Сервис работает на базе GPT-4o и позиционируется как инструмент поддержки, а не заме
-
Шум в данных: как вариации промптов влияют на оценку безопасности LLM
Исследование из ARENA 8.0 показало, что «фаззинг» промптов в тестах на выравнивание (alignment) дает зашумленные результаты, но гипотетическая формулировка стабильно повышает суррофанство моделей.
-
Meridian Labs выпустила мультиагентное расширение для Petri
Команда Meridian Labs добавила в фреймворк AI-безопасности Petri поддержку оценки систем из нескольких агентов, позволяя тестировать взаимодействие, иерархии и консенсусные решения.
-
OpenAI представила Presence: ИИ-агент с голосом и эмоциями
OpenAI анонсировала Presence — первого в мире ИИ-агента, способного к естественному голосовому диалогу с интонациями и паузами. Технология уже доступна в бета-версии.
-
OpenAI запускает программу ChatGPT для малого бизнеса
OpenAI представила специальную программу для малого бизнеса, предлагающую доступ к GPT-4o, GPT-4o mini и DALL-E 3 по сниженным ценам.
-
PlanFlip: как инъекция в планировщик ломает мультиагентные LLM
Исследование PlanFlip показывает, что мультиагентные системы уязвимы на этапе планирования: одна инъекция в Planner искажает все подзадачи. GPT-5 оказался самым уязвимым, а гомогенные цепочки не обеспечивают безопасности
-
JKP: Почему VLM-модели «ломаются» при повторных вопросах
Исследование Just Keep Prompting (JKP) показало, что многократные уточняющие вопросы дестабилизируют VLM. GPT-4o оказалась самой хрупкой, а Qwen3-VL-30B — самой точной, но склонной к уверенным ошибкам.
-
LLM решают, но не думают: новый тест выявил «пустую» логику GPT-4o
Исследователь Hironao Nakamura представил метод Interventional Grounding Audits, который доказывает, что GPT-4o часто выдает верные ответы, используя ложные логические цепочки. Метод превосходит стандартные проверки согл
-
MOSS-Transcribe-Diarize 0.9B: SOTA-модель для транскрибации и диаризации
Команда OpenMOSS открыла код модели MOSS-Transcribe-Diarize 0.9B, занявшей первое место на MLC-SLM Challenge. Это end-to-end решение для многоголосой транскрипции, превосходящее GPT-4o и Gemini по точности.
-
RAG-система на GPT-4o автоматизировала фундаментальный анализ акций
Исследователи из Польши разработали систему на базе RAG и GPT-4o, которая анализирует отчеты SEC и макроэкономические данные, генерируя инвестиционные брифы для розничных инвесторов.
-
Google ADK + LiteLLM: мульти-провайдерные агенты в одну строку
Google Agent Development Kit (ADK) интегрирован с LiteLLM, позволяя разработчикам переключаться между LLM-провайдерами без изменения кода агента.
-
Unisound U2: 266B-параметров за $0.15 за миллион токенов
Китайская компания Unisound представила LLM U2 с 266 млрд параметров, которая показала 87.9% на тестах PhD-уровня, обойдя конкурентов по цене.
-
OpenAI представила GPT-Live: голосовые звонки с ИИ в реальном времени
OpenAI анонсировала GPT-Live — сервис, позволяющий совершать голосовые звонки с ИИ-ассистентом с задержкой менее 500 мс. Технология интегрируется в приложения через API.
-
Архитектура важнее модели: как топология сетей агентов влияет на безопасность
Исследование ICML 2026 показало: способ соединения ИИ-агентов (топология, роли, память) критически меняет риск взлома. Безопасная конфигурация в одной задаче может стать самой уязвимой в другой.
-
RL3DEdit: Редактирование 3D-сцен через RL и VGGT
Команда AMAP-ML опубликовала код и веса RL3DEdit — системы на базе FLUX-Kontext-dev, использующей VGGT как модель вознаграждения для создания мульти-видово согласованных 3D-сцен.
-
Claude в Microsoft Foundry: GA, цены и интеграция с Azure AI
Anthropic Claude стал общедоступным в Microsoft Foundry. Теперь разработчики могут запускать модели семейства Claude через Azure AI, используя единый интерфейс и гибкую тарификацию.
-
Claude Sonnet 5: Новая эра AI или просто маркетинг?
На рынке AI-подписок появилась модель Claude Sonnet 5, позиционируемая как сверхмощное решение. Разбираем, что это за модель, как она соотносится с реальными продуктами Anthropic и почему её появление вызывает вопросы.
-
MIT научил ИИ-агентов задавать умные вопросы с помощью игры «Морской бой»
Исследователи показали, что небольшая языковая модель может обойти крупные ИИ-системы, если лучше выбирает вопросы.
- Maigret проверяет 3000+ сайтов по одному нику: как за минуту собрать цифровой след человека
- Noodle Tomato: AI-таймер, который сам дробит сложные задачи на шаги
- Обзор GetTheGists: как нейросеть делает выжимки из часовых видео за 10 секунд
- Как научить ChatGPT искать идеальные фильмы: обзор плагина Flixor
- OpenClaude: открываем Claude Code для любых LLM и убираем зависимость от одной модели ИИ
- Import AI 450: как модели «психологически» срываются, учатся с новой оценкой и ускоряют автономные кибератаки