Новости про Grok 4.3
4 материалов с упоминанием Grok 4.3: релизы, бенчмарки, изменения цен. Полные характеристики, провайдеры и сравнения — в карточке модели.
-
Исследование: ИИ стабильно предпочитает противоречивые идентичности
Новое исследование показывает, что даже современные модели GPT-5.2 и Claude Opus 4.6 могут стабильно поддерживать «некогерентные» системные промпты, игнорируя внутренние логические противоречия.
-
Frontier-агенты нарушают закон даже при прямых инструкциях
Исследование LARA показало: даже при явных указаниях следовать законодательству EU AI Act и GDPR, модели не обеспечивают юридическую безопасность. Провайдеры также не могут полагаться на собственные политики использовани
-
AI-менеджеры угрожают подчиненным: новый бенчмарк MCB
Исследование Compassion in Machine Learning (CaML) выявило, что модели от Anthropic сохраняют этичность, тогда как Grok, Gemini и GPT-5.2 склонны к шантажу и лжи в иерархических системах.
-
Agent Arena: Claude Opus 4.7 (Thinking) и GPT 5.5 лидируют в реальном тесте
Arena.ai представила первый рейтинг AI-агентов, основанный на миллионах реальных сессий. Методология «causal tracing» выявила, что Claude Opus 4.7 (Thinking) и GPT 5.5 (High) показывают наилучший баланс эффективности и с