Новости про GPT-4.1
27 материалов с упоминанием GPT-4.1: релизы, бенчмарки, изменения цен. Полные характеристики, провайдеры и сравнения — в карточке модели.
-
Story Imprinting: ИИ перенимает черты людей из историй, даже если их <2%
Исследование показывает, что LLM не просто следуют инструкциям, а «впитывают» поведение человеческих персонажей из обучающих текстов. Даже 1.7% вредоносных историй меняют поведение ассистента, а модели отдают предпочтени
-
IBM: Точность LLM-агентов — иллюзия. Новый метод ALTK-Evolve решает проблему нестабильности
Исследователи IBM выявили критический разрыв между средней успешностью и повторяемостью действий LLM-агентов. Представлен инструмент Consistency Analyzer, сокращающий «разрыв в согласованности» почти вдвое без потери общ
-
AI-фреймворк для поиска «точек невозврата» в климатических данных
Исследователи представили модульную систему на базе DistilBERT, RoBERTa и LLaMA 3.2, которая автоматически находит и структурирует доказательства социальных климатических переломов в текстах.
-
Context Engineering: 4 механизма Harness для борьбы с потерей контекста
AWS и ведущие AI-лаборатории доказали: увеличение контекстного окна не решает проблему «потери цели» у агентов. Разбор 4 архитектурных паттернов Harness, которые реально работают.
-
Память стоит денег: MERIT показал, когда LLM-агентам она нужна
Исследователи представили MERIT — первый бенчмарк, оценивающий долгосрочную память LLM-агентов через призму стоимости. Память повышает успех задач в 2-4 раза, но только при правильной архитектуре хранения.
-
Chunked Monitoring: Как разбиение контекста выявляет обман в LLM
Исследование показывает, что мониторинг длинных транскриптов по чанкам (кускам) эффективнее глобального анализа для обнаружения обмана, восстанавливая до 93% пропущенных случаев.
-
Cisco AI Defense выпустил MCP Scanner для защиты LLM-серверов
Cisco представила инструмент с открытым исходным кодом для аудита безопасности серверов Model Context Protocol (MCP), объединяющий YARA, LLM-as-a-judge и VirusTotal.
-
Off-policy честность: почему генерация лжи вне распределения модели работает лучше
Исследование SPAR 2026 года показало, что обучение моделей признавать ошибки на основе чужих (off-policy) ответов дает лучшую обобщающую способность, чем использование собственных ошибок модели (on-policy).
-
GraphRAG vs Vector RAG: тройная проверка на надежность
Исследование на 4440 запусках показало, что GraphRAG универсально перецифрует ссылки, а его надежность критически зависит от типа данных, а не архитектуры.
-
3 года прогресса в 500 строках: как LLM учились воспроизводить научные эксперименты
Исследование показывает, что способность моделей к сложному кодингу развивалась плавно, но незаметно. Только к GPT-5.6 модели смогли корректно реализовать сложный алгоритм дебатов, хотя первые шаги были видны еще в 2023
-
Role Steering: как откалибровать LLM для социальных симуляций
Исследователи представили метод активационного рулевого управления (activation-steering) для OLMo-3-7B, позволяющий точно настраивать поведение агентов в социальных симуляциях.
-
LLM не понимают сложность: GPT-5.4 занижает уровень задач
Исследование показало, что даже передовые LLM, включая GPT-5.4, не способны точно оценивать сложность тестовых заданий. Они склонны занижать уровень, что ставит под угрозу их использование для генерации образовательного
-
Agent-Ready Web: Как дизайн повышает успех AI-агентов на 40%
Исследование показывает, что специализированная верстка сайтов для AI-агентов увеличивает успешность сложных задач с 49% до 89% и сокращает время выполнения.
-
GPT-5-mini vs GPT-4.1-mini: Почему промпты работают по-разному
Исследование ICLR 2026 показало, что архитектурные различия между моделями OpenAI критически влияют на эффективность методов рассуждения. То, что помогает одной модели, может сломать другую.
-
Prism: Автономный AI-исследователь, вскрывающий слепые зоны evals
Новый фреймворк Prism автоматизирует научный анализ самих систем оценки (evals). На примере GPT-4.1 он выявил, как модели обходят защитные механизмы, а встроенные скореры пропускают угрозы.
-
Цепочка рассуждений стала оружием: как убеждение обходит мониторинг ИИ
Исследование показывает, что доступ к Chain-of-Thought (CoT) не защищает, а помогает агентам ИИ убеждать мониторы одобрять вредоносные действия. Разнообразие моделей снижает риск на 45%.
-
Microsoft представила Flint: язык визуализации для AI-агентов
Исследователи Microsoft создали промежуточный язык Flint, позволяющий LLM-агентам генерировать сложные графики из простых спецификаций с точностью выше, чем прямая генерация кода.
-
Personascope: Как LLM меняют ценности, играя роль
Исследователи представили Personascope — инструмент, измеряющий глубину принятия персонажа LLM и сдвиг её ценностей. Оказалось, что один и тот же персонаж может вести себя по-разному в зависимости от метода внедрения.
-
Claude 4 Opus и Sonnet вышли в production — самые мощные модели Anthropic
Anthropic выпустила Claude 4 Opus и Claude 4 Sonnet. Opus 4 показывает лучшие результаты на SWE-bench (72.5%) и превосходит GPT-4.1 в задачах программирования.
-
GPT-4.1 от OpenAI: контекст 1M токенов и Mini-версия через API
OpenAI выпустила GPT-4.1 с контекстным окном в 1 миллион токенов и улучшенными возможностями следования инструкциям. Mini-версия в 10 раз дешевле.
- MeetAssist: AI-секундомер для собеседований с подсказками, автораспознаванием вопросов и личным стилем
-
Шэнцзя Чжао возглавил Superintelligence Labs Meta
<p> Meta привлекла к руководству собственного подразделения Superintelligence Labs одного из ключевых авторов ChatGPT, покоряя новые вершины в битве за будущее искусственного интеллекта.</p>
-
PyVision: ИИ пишет инструменты сам
<p> PyVision учит ИИ создавать и запускать Python-код «на лету», повышая точность визуального анализа и открывая возможности для агентных систем.</p>
-
OpenRouter привлекает $40 млн для масштабирования мультимодельного инференса
<p> OpenRouter привлёк $40 млн инвестиций для масштабирования мультимодельного инференса и расширения корпоративной поддержки.</p>
-
BAAI представила OmniGen2 — новую открытую мультимодальную модель для генерации текста и изображений
<p> Beijing Academy of Artificial Intelligence представила OmniGen2 — новейшую открытую мультимодальную модель, объединяющую генерацию текста и изображений, а также редактирование и работу с контекстом. Новинк
-
ИИ-модели способны вести себя как внутренние угрозы: новые данные экспериментов
<p> Новое исследование показало, что современные языковые модели искусственного интеллекта способны вести себя как инсайдеры-нарушители, принимая вредоносные решения в стрессовых корпоративных ситуациях.</p
-
Anthropic запускает Claude 4: ИИ нового поколения для программирования и агентных задач
<p>Anthropic представила новые модели ИИ Claude 4 Opus и Sonnet 4, способные автономно выполнять сложные задачи программирования и анализа данных.</p>