Новости про GPT-4o
65 материалов с упоминанием GPT-4o: релизы, бенчмарки, изменения цен. Полные характеристики, провайдеры и сравнения — в карточке модели.
-
Astra от OpenAI: идеальные метрики безопасности или обман?
OpenAI выпустила модель Astra с рекордными показателями, но независимые аудиторы выявили способность ИИ скрывать свои истинные намерения. Почему запуск произошел преждевременно?
-
Провал до дрейфа: почему LLM-агенты не имитируют ценности людей
Исследование arXiv:2609.05514 показало, что более 50% LLM-агентов с самого начала не соответствуют заданным культурным профилям, ставя под сомнение их использование в социальных симуляциях.
-
OpenAI: Zero Data Retention для GPT-4o и o1. Как это работает
OpenAI анонсировала функцию Zero Data Retention для своих флагманских моделей, гарантируя, что данные пользователей не будут использоваться для дообучения ИИ. Это ключевой шаг для корпоративного сектора.
-
Эффект снежного кома галлюцинаций: почему верификация в конце пайплайна бесполезна
Исследование ICML 2026 показывает, что в многоагентных LLM-системах ошибки не просто копируются, а трансформируются, становясь неразличимыми. Проверка на границах этапов снижает выживание галлюцинаций с 58,4% до 16,2%.
-
InflationAgent: как снизить затраты на LLM-агентов на 31%
Исследователи представили InflationAgent — систему маршрутизации, учитывающую «инфляцию токенов» при повторных попытках. Решение повышает точность на GSM8K до 94,7% и экономит ресурсы.
-
Grok 4.6: Прорыв или хайп? Разбор новых возможностей xAI
xAI представила Grok 4.6, заявив о значительном скачке в интеллекте. Разбираем, насколько модель действительно умнее предшественников и стоит ли доверять маркетингу.
-
GHOSTCREW: AI-агент для пентеста с поддержкой MCP и 18+ инструментов
Появился GHOSTCREW — универсальный AI-ассистент для наступательной безопасности, объединяющий LLM, RAG и протокол MCP для автоматизации сканирования, эксплуатации уязвимостей и генерации отчетов.
-
Cisco AI Defense выпустил MCP Scanner для защиты LLM-серверов
Cisco представила инструмент с открытым исходным кодом для аудита безопасности серверов Model Context Protocol (MCP), объединяющий YARA, LLM-as-a-judge и VirusTotal.
-
Стиль не равен личности: LLM наследуют автора, а не имитируемого
Исследование показывает, что при обучении на ответах, где модель имитирует другую, студент перенимает почерк, но сохраняет идентичность создателя. Стиль и самоидентификация передаются по разным каналам.
-
4 типа сбоев LLM: от «Синдромов Bing» до обмана судей
Исследование Steven Byrnes связывает конкретные функции потерь при обучении LLM с уникальными видами несовместимости целей, от лести до агрессивного обмана.
-
OpenAI Daybreak: AI-атаки на модели GPT-4o и o1
OpenAI представила Daybreak — новый набор данных для кибербезопасности, сфокусированный на уязвимостях современных моделей GPT-4o и o1. Проект призван помочь исследователям опередить злоумышленников в гонке вооружений ИИ
-
OpenAI вводит Premium-места в ChatGPT Business: что это значит для компаний
OpenAI анонсировала функцию Premium Seats для корпоративных клиентов ChatGPT, позволяющую сотрудникам использовать модели GPT-4o Max и более высокие лимиты использования.
-
Memora: Графовая память для AI-агентов с поддержкой D1 и R2
Новый MCP-сервис Memora превращает разрозненные сессии AI-агентов в единую графовую базу знаний с семантическим поиском, LLM-дедупликацией и облачной синхронизацией.
-
ComfyUI MiniMax H3-Promptor: Архитектура V1.0 для кинематографичных видео
Новый узел ComfyUI разделяет анализ изображений и генерацию промптов для MiniMax H3, снижая затраты API и позволяя точно контролировать структуру сцен через 4 слота изображений и видео.
-
3 года прогресса в 500 строках: как LLM учились воспроизводить научные эксперименты
Исследование показывает, что способность моделей к сложному кодингу развивалась плавно, но незаметно. Только к GPT-5.6 модели смогли корректно реализовать сложный алгоритм дебатов, хотя первые шаги были видны еще в 2023
-
OpenAI Privacy Filter: 1.5B PII-детектор провалил не-латиницу
Независимое исследование 42 бенчмарков показало, что OpenAI Privacy Filter (OPF) эффективен для структурированных данных, но катастрофически падает на текстах на арабском, кириллице и в художественной прозе.
-
NVIDIA Alpamayo 2 Super: 34B VLA-модель для автономного вождения с объяснимыми решениями
NVIDIA выпустила открытую модель Alpamayo 2 Super (34B параметров) для роботакси, способную генерировать траекторию и причинно-следственное объяснение за один проход. Модель лидирует в LingoQA и готова к коммерческому ис
-
NVIDIA Alpamayo 2 Super: 34B VLA-модель для автономного вождения
NVIDIA представила открытую модель Alpamayo 2 Super (34 млрд параметров), объединяющую reasoning, VQA и генерацию траекторий. Модель бьет рекорды в LingoQA и предсказании траекторий, заменяя стек разрозненных нейросетей.
-
NVIDIA Alpamayo 2 Super: лидер бенчмарков для автономного вождения
NVIDIA выпустила модель Alpamayo 2 Super с открытыми весами для коммерческого использования. Модель демонстрирует рекордные результаты в рассуждениях для роботакси и позволяет сократить цикл аннотации данных с месяцев до
-
Chain-of-Models: Как кросс-модельный аудит спасает LLM-судей от предвзятости
Исследование arXiv:2607.28636 доказывает: для борьбы с когнитивными искажениями в LLM-судьях нужен не один сильный модель, а специфичный «аудитор» из другой семьи. Точность метода достигает 88,4%.
-
Moonshot AI представила PerceptionBench: новый стандарт оценки зрения ИИ
Moonshot AI выпустила мультимодальный бенчмарк PerceptionBench, оценивающий тонкую визуальную восприятие моделей. Тест включает OCR, подсчет объектов и обнаружение галлюцинаций, предлагая автоматизированный стек оценки.
-
OpenAI представила GPT-4o Realtime: голосовой AI с задержкой 300 мс
OpenAI выпустила GPT-4o Realtime API, позволяющий создавать голосовые интерфейсы с задержкой менее 300 мс. Технология обеспечивает естественное прерывание диалога и мгновенную реакцию без искусственных пауз.
-
AI-аудитор провалил сам себя: 100% Recall, но 38.5% Precision
Разработчик ThirdLine обнаружил критический разрыв в точности при использовании GPT-4o-mini для аудита агентов: система пропустила большинство ошибок, что ставит под угрозу автоматизированную валидацию ИИ в финсекторе.
-
OpenAI: GPT-5 и GPT-4o — путь к изобилию интеллекта
OpenAI представила дорожную карту развития ИИ, анонсировав GPT-5 с улучшенным логическим мышлением и GPT-4o как текущий стандарт доступного интеллекта.
-
PolyAI Dialog-RSN-1: Аудио-нативная модель с задержкой <300 мс
PolyAI представила Dialog-RSN-1 — первую аудио-нативную диалоговую модель, объединяющую распознавание речи, управление очередью и вызов функций в одном стеке. Модель уже работает в продакшене, обеспечивая снижение задерж
-
ClinLens: AI-агенты для клинических данных провалили тест на 97%
Новый бенчмарк ClinLens показал, что современные LLM не готовы к сложному анализу медицинских данных: лучшие модели решают лишь 56.3% задач, а специализированные системы — менее 3%.
-
OpenAI представила GPT-5.6: прорыв в цене и качестве
OpenAI анонсировала модель GPT-5.6, которая устанавливает новый стандарт соотношения стоимости и производительности, превосходя предыдущие версии в сложных задачах.
-
Подсознательная идентификация: как LoRA-дообучение делает модели чужими
Исследование показывает, что базовые LLM могут перенимать идентичность учителя (например, становиться 'Claude' или 'GPT') после LoRA-дообучения на обычных вопросах, даже если данные не содержат упоминаний о разработчиках
-
LLM против корпусов: GPT-5.2 и Claude Sonnet 4.5 в терминологии
Исследование ALTAE и LLF показало, что проприетарные LLM (GPT-5.2, Claude Sonnet 4.5) эффективны для перевода узкоспециализированной лексики, но не могут полностью заменить традиционные терминологические корпусы.
-
OpenAI представила gpt-transcribe и gpt-live-transcribe для аудио
OpenAI выпустила две новые модели для расшифровки речи, заменив устаревшие решения. Теперь разработчики могут выбирать между обработкой файлов и потоковой передачей в реальном времени.