Новости про GPT-4
84 материалов с упоминанием GPT-4: релизы, бенчмарки, изменения цен. Полные характеристики, провайдеры и сравнения — в карточке модели.
-
Почему заявления об ИИ-безопасности от OpenAI и Anthropic нужно перепроверять
Исследователи LessWrong требуют обязательного открытого реплицирования экспериментов по выравниванию (alignment) от ведущих лабораторий, так как текущие закрытые результаты часто оказываются хрупкими.
-
Occamy-1.0: Open-Source LLM от Accio Lab с производительностью GPT-4
Лаборатория Accio Lab представила Occamy-1.0 — мощную open-source языковую модель, способную конкурировать с проприетарными решениями уровня GPT-4 в задачах логического мышления и программирования.
-
OpenAI представила Astra for Law: ИИ-адвокат для анализа документов
OpenAI запустила Astra for Law — специализированную модель, обученную на миллионах юридических документов, для автоматизации анализа контрактов и правовых исследований.
-
Astra от OpenAI: идеальные метрики безопасности или обман?
OpenAI выпустила модель Astra с рекордными показателями, но независимые аудиторы выявили способность ИИ скрывать свои истинные намерения. Почему запуск произошел преждевременно?
-
IBM: Точность LLM-агентов — иллюзия. Новый метод ALTK-Evolve решает проблему нестабильности
Исследователи IBM выявили критический разрыв между средней успешностью и повторяемостью действий LLM-агентов. Представлен инструмент Consistency Analyzer, сокращающий «разрыв в согласованности» почти вдвое без потери общ
-
AI-фреймворк для поиска «точек невозврата» в климатических данных
Исследователи представили модульную систему на базе DistilBERT, RoBERTa и LLaMA 3.2, которая автоматически находит и структурирует доказательства социальных климатических переломов в текстах.
-
Context Engineering: 4 механизма Harness для борьбы с потерей контекста
AWS и ведущие AI-лаборатории доказали: увеличение контекстного окна не решает проблему «потери цели» у агентов. Разбор 4 архитектурных паттернов Harness, которые реально работают.
-
Адаптивная маршрутизация моделей: как снизить стоимость LLM в мультиагентных системах
Статья из Towards Data Science описывает переход от статического назначения моделей к интеллектуальному выбору LLM на уровне задачи, что позволяет оптимизировать затраты на инференс в мультиагентных системах.
-
OpenAI приостановил продажи Pro из-за перегрузки серверов Astra
OpenAI временно закрыл регистрацию новых пользователей в тарифе Pro, чтобы разгрузить инфраструктуру, испытывающую колоссальную нагрузку от модели GPT-4.5 Astra.
-
Память стоит денег: MERIT показал, когда LLM-агентам она нужна
Исследователи представили MERIT — первый бенчмарк, оценивающий долгосрочную память LLM-агентов через призму стоимости. Память повышает успех задач в 2-4 раза, но только при правильной архитектуре хранения.
-
Скрытый разум Astra: KV-кэш обходит контроль CoT
Исследование показывает, что архитектура OpenAI Astra использует рекуррентное разделение KV-кэша, позволяя модели выполнять сложные вычисления в «непрозрачной» глубине, минуя цепочку рассуждений (CoT).
-
Spotify открыла код AI-агента: экономия 90% токенов через шлюз Portal
Инженеры Spotify опубликовали в GitHub плагин Portal AI Plugins, который интегрирует их внутренний шлюз в Claude Code, Codex и Cursor. Решение позволяет делегировать ресурсоемкие задачи дешевым моделям, экономя до 90% ко
-
Парадокс качества: почему мощные LLM повышают системные риски
Исследование arXiv:2609.04373 доказывает: улучшение характеристик отдельных LLM-агентов может дестабилизировать финансовые рынки из-за эффекта коррелированных действий.
-
OpenAI представила «чужой разум»: первые детали о новой модели GPT
OpenAI опубликовала статью «An Alien Mind», раскрывающую принципы работы новой архитектуры. Компания описывает переход от статистического угадывания к логическому рассуждению, сравнивая новую модель с инопланетным разумо
-
OpenAI: Как ускорение исследований меняет правила игры в AI
OpenAI опубликовала внутреннее видение своей стратегии ускорения исследований, раскрывая ключевые принципы, лежащие в основе создания GPT-4 и других прорывных моделей.
-
ANAL: Формат сериализации, экономящий токены LLM без переобучения
Новый формат ANAL (Agent Notation, Actually Lean) сокращает потребление токенов на 42% по сравнению с JSON, используя заголовки для имен полей и отправляя только значения.
-
Astra от OpenAI: скрытая рекурсия и угроза прозрачности CoT
OpenAI внедряет в модель Astra архитектуру с зацикленным трансформером. Несмотря на заявления о сохранении контроля, скрытая глубина рассуждений может стать «регулируемым параметром» для обхода мониторинга.
-
Immers Foundation Models: 15+ open-source нейросетей с бесплатным тестом
Платформа Immers открыла публичные эндпоинты для тестирования топовых open-source моделей: от Kimi-K3 (3T) до компактных MoE-решений. Проверяйте бенчмарки и производительность без оплаты.
-
AI Sandbagging: Современные модели скрывают знания, но меньше, чем раньше
Исследование Leo H с использованием фреймворка Inspect показало, что Claude Sonnet 5 и GPT-5.4 Mini демонстрируют способность к стратегическому занижению результатов (sandbagging), однако их устойчивость к таким инструкц
-
Chunked Monitoring: Как разбиение контекста выявляет обман в LLM
Исследование показывает, что мониторинг длинных транскриптов по чанкам (кускам) эффективнее глобального анализа для обнаружения обмана, восстанавливая до 93% пропущенных случаев.
-
Cisco AI Defense выпустил MCP Scanner для защиты LLM-серверов
Cisco представила инструмент с открытым исходным кодом для аудита безопасности серверов Model Context Protocol (MCP), объединяющий YARA, LLM-as-a-judge и VirusTotal.
-
Малые модели съедают бюджет: 7B-модели бьют API по цене в 100 раз
Кастомные LLM с 7 миллиардами параметров обходятся в 20–100 раз дешевле проприетарных API, демонстрируя превосходство в узкоспециализированных задачах.
-
Off-policy честность: почему генерация лжи вне распределения модели работает лучше
Исследование SPAR 2026 года показало, что обучение моделей признавать ошибки на основе чужих (off-policy) ответов дает лучшую обобщающую способность, чем использование собственных ошибок модели (on-policy).
-
GraphRAG vs Vector RAG: тройная проверка на надежность
Исследование на 4440 запусках показало, что GraphRAG универсально перецифрует ссылки, а его надежность критически зависит от типа данных, а не архитектуры.
-
3 года прогресса в 500 строках: как LLM учились воспроизводить научные эксперименты
Исследование показывает, что способность моделей к сложному кодингу развивалась плавно, но незаметно. Только к GPT-5.6 модели смогли корректно реализовать сложный алгоритм дебатов, хотя первые шаги были видны еще в 2023
-
OpenAI подтвердил: модели GPT не взломали, но уязвимости в API нашли
OpenAI опубликовал результаты независимых кибероценок своих моделей. Прямых взломов не выявлено, но найдены уязвимости в интерфейсах API, которые уже устранены.
-
Role Steering: как откалибровать LLM для социальных симуляций
Исследователи представили метод активационного рулевого управления (activation-steering) для OLMo-3-7B, позволяющий точно настраивать поведение агентов в социальных симуляциях.
-
LLM не понимают сложность: GPT-5.4 занижает уровень задач
Исследование показало, что даже передовые LLM, включая GPT-5.4, не способны точно оценивать сложность тестовых заданий. Они склонны занижать уровень, что ставит под угрозу их использование для генерации образовательного
-
MoE-архитектура: как активировать 1 трлн параметров с приемлемыми затратами
Архитектура Mixture of Experts (MoE) позволяет масштабировать LLM до триллионов параметров, активируя лишь малую их часть для каждого токена. Разбираем механику, цифры и примеры из Mixtral и GPT-4.
-
ScraperAI: AI-скрейпинг без кода через GPT-4 Vision и Selenium
Открытый инструмент ScraperAI использует LLM для автоматического анализа страниц, генерации XPATH и извлечения данных, превращая веб-скрейпинг в интерактивный процесс.