Новости про GPT-4
85 материалов с упоминанием GPT-4: релизы, бенчмарки, изменения цен. Полные характеристики, провайдеры и сравнения — в карточке модели.
-
ScraperAI: AI-скрейпинг без кода через GPT-4 Vision и Selenium
Открытый инструмент ScraperAI использует LLM для автоматического анализа страниц, генерации XPATH и извлечения данных, превращая веб-скрейпинг в интерактивный процесс.
-
OpenAI представила GPT-5.6: прорыв в цене и качестве
OpenAI анонсировала модель GPT-5.6, которая устанавливает новый стандарт соотношения стоимости и производительности, превосходя предыдущие версии в сложных задачах.
-
Microsoft открыто конкурирует с OpenAI и Anthropic: новые модели и Mythos
Microsoft представила собственные AI-модели, инструменты и платформу Mythos, заявив о прямой конкуренции с OpenAI и Anthropic на фоне планов роста.
-
Kimi K3: 2.8 трлн параметров и MoE-архитектура от Moonshot AI
Moonshot AI представила Kimi K3 — открытую модель с 2.8 триллионами параметров, использующую архитектуру Mixture-of-Experts (MoE) с 16 активными экспертами для эффективной работы с длинным контекстом.
-
LLM-каскад для RAG: как сэкономить бюджет, используя локальные модели
Исследование показывает, что использование цепочки из дешевой локальной модели и флагманского API снижает затраты на RAG, повышая точность за счет валидации и глоссариев.
-
MAR-12: AI научился видеть зло под маской мемов
Новая модель MAR-12 решает проблему «токсичного юмора», анализируя мемы через 12 теоретических призм. Система не только классифицирует контент, но и объясняет, почему шутка вредна.
-
Inkling от Thinking Machines: 975B параметров без гонки за лидербордами
Thinking Machines выпустили модель Inkling объемом 975B под лицензией Apache 2.0. Главная цель — не победа в бенчмарках, а создание открытой базы для исследований.
-
Agent-Ready Web: Как дизайн повышает успех AI-агентов на 40%
Исследование показывает, что специализированная верстка сайтов для AI-агентов увеличивает успешность сложных задач с 49% до 89% и сокращает время выполнения.
-
GPT-5-mini vs GPT-4.1-mini: Почему промпты работают по-разному
Исследование ICLR 2026 показало, что архитектурные различия между моделями OpenAI критически влияют на эффективность методов рассуждения. То, что помогает одной модели, может сломать другую.
-
Сжатие LLM-бенчмарков: как семантические эмбеддинги экономят вычисления
Исследователи представили метод отбора репрезентативных подмножеств промптов (coresets) для оценки LLM, который превосходит традиционные подходы, используя только семантические векторы без запуска моделей.
-
Prism: Автономный AI-исследователь, вскрывающий слепые зоны evals
Новый фреймворк Prism автоматизирует научный анализ самих систем оценки (evals). На примере GPT-4.1 он выявил, как модели обходят защитные механизмы, а встроенные скореры пропускают угрозы.
-
Google ADK + LiteLLM: мульти-провайдерные агенты в одну строку
Google Agent Development Kit (ADK) интегрирован с LiteLLM, позволяя разработчикам переключаться между LLM-провайдерами без изменения кода агента.
-
DorkAgent v1.4: LLM-агент для автоматизации Google Dorking в пентесте
Разработчик yee-yore выпустил DorkAgent v1.4 — инструмент на базе CrewAI, который использует LLM для автоматического поиска уязвимостей через Google Dorking. Обновление добавило динамический выбор моделей и модульную арх
-
Цепочка рассуждений стала оружием: как убеждение обходит мониторинг ИИ
Исследование показывает, что доступ к Chain-of-Thought (CoT) не защищает, а помогает агентам ИИ убеждать мониторы одобрять вредоносные действия. Разнообразие моделей снижает риск на 45%.
-
Large Behavior Model: Цифровой двойник покупателя на базе LLM
Исследователи представили LBM — модель, которая предсказывает покупки и реакцию на акции, обучаясь на реальных транзакциях, а не на общих текстах.
-
Microsoft представила Flint: язык визуализации для AI-агентов
Исследователи Microsoft создали промежуточный язык Flint, позволяющий LLM-агентам генерировать сложные графики из простых спецификаций с точностью выше, чем прямая генерация кода.
-
Nemotron 3 Ultra против закрытых моделей: LangChain добилась рекорда с открытым стеком
NVIDIA Nemotron 3 Ultra в связке с LangChain Deep Agents показала точность, сопоставимую с ведущими проприетарными моделями, но при стоимости инференса в 10 раз ниже. Главное достижение — улучшение за счет настройки окру
-
Personascope: Как LLM меняют ценности, играя роль
Исследователи представили Personascope — инструмент, измеряющий глубину принятия персонажа LLM и сдвиг её ценностей. Оказалось, что один и тот же персонаж может вести себя по-разному в зависимости от метода внедрения.
-
MedCalc-Pro: LLM-агенты решают сложные мед. расчеты с точностью до 90%
Исследователи представили MedCalc-Pro — новый бенчмарк и фреймворк для LLM-агентов, способных выполнять многошаговые медицинские вычисления в реальных клинических сценариях.
-
LongCat-2.0: 1.6 трлн параметров, MIT-лицензия и победа над Gemini 3.1 Pro
Meituan выпустила первую полностью открытую LLM с архитектурой MoE на 1.6 трлн параметров. Модель демонстрирует лидерство в задачах программирования и обходит проприетарные аналоги, используя собственные AI-ASIC.
-
Claude 4 Opus и Sonnet вышли в production — самые мощные модели Anthropic
Anthropic выпустила Claude 4 Opus и Claude 4 Sonnet. Opus 4 показывает лучшие результаты на SWE-bench (72.5%) и превосходит GPT-4.1 в задачах программирования.
- Local Deep Research: Бесплатный AI-аналитик, который ищет информацию за вас
- OpenAI открыли доступ к GPT-5.5 Instant: точность ответов выросла на 52,5%
- Илон Маск признался в суде: нейросеть Grok от xAI обучали на данных OpenAI
- AskFred: ИИ-ассистент, который слушает созвоны и читает документы за вас
- Обзор WebZum 2.5.1: Нейросеть, которая читает сайты и видео за вас
- Китай запретил Meta покупать AI-стартап Manus за $2 млрд: фаундеров не выпустили из страны
-
GPT-4.1 от OpenAI: контекст 1M токенов и Mini-версия через API
OpenAI выпустила GPT-4.1 с контекстным окном в 1 миллион токенов и улучшенными возможностями следования инструкциям. Mini-версия в 10 раз дешевле.
- MeetAssist: AI-секундомер для собеседований с подсказками, автораспознаванием вопросов и личным стилем
-
ИИ-чатботы хуже работают для уязвимых пользователей: исследование MIT
<p>Новое исследование показывает, что ведущие модели ИИ, включая GPT-4 и Llama 3, часто дают менее точные ответы для пользователей с непредсказуемыми навыками английского и образованием.</p>