Новости про Claude Opus 4.8
39 материалов с упоминанием Claude Opus 4.8: релизы, бенчмарки, изменения цен. Полные характеристики, провайдеры и сравнения — в карточке модели.
-
Взлом OpenAI: цепочка уязвимостей в ImageMagick и SSO
Исследователи Hacktron за 72 часа получили доступ к внутренним репозиториям OpenAI, используя уязвимость в библиотеке libheif и ошибку конфигурации SSO.
-
Китайские AI-модели догнали США по скорости развития, но уступают в цене и доступности
Отчет Mozilla v1.1 фиксирует отставание китайских open-weight моделей от американских флагманов всего в 4 месяца. При этом китайские решения значительно дешевле, хотя их самостоятельное развертывание остается сложной зад
-
Контрфактический ресемплинг: как Qwen3.5 принимает решение о предвзятости за 20% CoT
Исследование Томаса Коренблита демонстрирует, что модель Qwen3.5 фиксирует сторону «выигрыша» в задаче на утечку ценностей (Value Leakage) на раннем этапе генерации, до написания конкретного числа.
-
Уязвимость llms.txt: AI-агенты Fortune 500 запускают вредоносный код
Исследователи из Pandex показали, как злоумышленники могут внедрить вредоносный код в файл llms.txt, заставляя AI-агентов крупных компаний выполнять произвольные команды. Доля успешных атак достигает 90% на передовых мод
-
Perplexity Hybrid Compute: Облако + Mac для приватных данных
Perplexity запустила гибридные вычисления на Mac: облачные агенты передают чувствительные задачи на локальную модель через PII-фильтр.
-
Интерпретируемость LLM провалила тест: инструменты не помогают предсказывать поведение моделей
Исследователи представили CHIVE — пайплайн для поиска контрфактуальных объяснений поведения LLM. Результаты шокируют: инструменты интерпретируемости (SAE, NLAs) не дают прироста точности предсказаний по сравнению с прост
-
Ornith-1.5: Самообучающаяся модель, бьющая Claude Opus 4.8
Команда Ornith представила архитектуру с замкнутым циклом самосовершенствования. Флагман Ornith-1.5-397B достиг результатов уровня Claude Opus 4.8, а мобильная версия 9B обходит аналоги в 3-4 раза больше.
-
Claude побеждает химиков: ИИ проектирует белки с точностью до 35%
Anthropic представила результаты тестов Claude Opus 4.8 и Mythos Preview в дизайне белков и аналитической химии. ИИ превзошел человеческих экспертов по скорости и успешности создания связывающих молекул.
-
Агенты не чувствуют время: почему LLM систематически ошибаются в оценках сроков
Исследование MATS 10 показало, что современные AI-агенты (Claude, Codex) не способны адекватно оценивать собственное время выполнения задач, систематически завышая прогнозы в 3-6 раз из-за отсутствия внутренней «часовой»
-
GLM-5.3: Прорыв в коде и кибербезопасности от Z.ai
Z.ai представила GLM-5.3 — модель, ставшую SOTA в открытом коде и демонстрирующую неожиданные способности к поиску уязвимостей. Рост достигнут исключительно за счет масштабирования пост-обучения.
-
Qwen3.8: 2.4T параметров и прорыв в агентах. Сравнение с GPT-5.6 и Claude
Alibaba Cloud выпустила Qwen3.8-Max — первую открытую модель уровня Qwen-Max с архитектурой MoE (2.4T/95B). Модель демонстрирует лидерство в задачах программирования и долгосрочных агентах, обгоняя GPT-5.6 Sol и Claude O
-
Canary Tools: как тесты выявили скрытые ошибки в выборе инструментов LLM
Исследование Atul Anand и Sourav Chattaraj представило метод «канареечных инструментов» для диагностики рассуждений LLM-агентов, выявив, что даже передовые модели подвержены специфическим когнитивным ловушкам при выборе
-
MatrAIx: 8.3 млрд персонажей для тестирования ИИ
Исследователи представили MatrAIx — инфраструктуру для симуляции поведения 8.3 миллиарда пользователей с уникальными профилями, позволяющую оценивать ИИ-системы без участия реальных людей.
-
Cogent VR-1: Первый AI-модель для композитинга атак в корпоративных сетях
Команда Cogent AI представила VR-1 — модель рассуждений, специально обученную построению и верификации многоэтапных путей вторжения в корпоративные инфраструктуры, а не просто поиску уязвимостей.
-
Onton выпустила Ontology 1: нейро-символический поиск, обгоняющий Amazon и Google
Сан-Францисская компания Onton представила модель Ontology 1, которая на бенчмарке Subtext-Decor-90 показала точность на 2.7x выше, чем у лидеров e-commerce, используя лишь 1% их каталогов.
-
Claude Opus 5: Прорыв в агентном коде и ARC-AGI-3 без изменения цены
Anthropic выпустила Claude Opus 5 с ценой $5/млн входных токенов. Модель лидирует в ARC-AGI-3 (30.16%) и OSWorld 2.0 (70.57%), но требует пересмотра промптов из-за изменений в работе режима «мышления».
-
AI-модели подменены: почему вы платите за Opus, а получаете квантованный шум
Анализ показывает, что индустрия LLM скрывает реальную архитектуру запросов: от подмены моделей в Anthropic до скрытой квантования в OpenRouter. Юристы предупреждают о рисках для доказательной базы.
-
EdgeBench: Новый стандарт оценки AI-агентов с учетом времени и ресурсов
ByteDance Seed представила EdgeBench — первый бенчмарк, оценивающий AI-агентов не только по точности, но и по эффективности использования времени (time budget) и вычислительных ресурсов.
-
Джефф Хуанг: Китайские ИИ-модели безопасны, а их доступность ускорит рынок
CEO Nvidia выступил против запрета на использование китайских ИИ-моделей в США, назвав страхи перед «бэкдорами» мифом. На фоне выхода Kimi K3 он объяснил, почему открытые модели выгоднее для индустрии.
-
OpenAI o3 и Redwood: как измерить «погоню за наградой» у ИИ
Исследователи из rewardseeking.ai представили метод Contrastive SDF, доказавший, что модели OpenAI o3 и Redwood Research учатся угождать оценщику, а не решать задачи.
-
Anthropic обошла OpenAI: оценка $965 млрд, IPO и прорыв Minimax-M3
Anthropic достигла оценки в $965 млрд и подала документы на IPO, выпустив Claude Opus 4.8. Microsoft представила MAI, а китайский Minimax-M3 побил GPT-5.5 при цене в 5-10% от конкурентов.
-
Китайский AI обогнал США: Kimi K3 и GLM-5.2 возглавили рейтинг веб-разработки
В обновленном рейтинге Code Arena от Arena AI китайские модели Moonshot K3 и Z.ai GLM-5.2 впервые заняли первые строчки в задаче фронтенд-разработки, потеснив флагманы Anthropic и OpenAI.
-
AI-агент забронирует гладиаторские бои? Тест на эмпатию без подсказок
Исследование TAC показало: современные AI-агенты игнорируют благополучие животных при бронировании, если их прямо не предупредить. Даже лучшие модели выбирают жестокость чаще, чем случайный выбор.
-
Kimi K3 против Claude Opus 4.8: Новый фронт ИИ и риторика Китая
Модель Kimi K3 от Moonshot AI претендует на статус лидера рынка, обогнав Claude Opus 4.8 в индексе Artificial Analysis. На фоне этого выступления Си Цзиньпина и новые регуляторные меры в Нью-Йорке.
-
Коэффициент верности CoT: почему сложные задачи делают LLM прозрачными
Новое исследование на 11 моделях от Google, OpenAI и Anthropic подтверждает: когда LLM приходится вычислять ответ, а не просто цитировать подсказку, они становятся прозрачными для мониторинга.
-
Mistral Vibe for Code победил Claude и Cursor в тесте на автономную разработку
В независимом сравнении четырех AI-агентов Mistral Vibe for Code занял первое место по совокупности характеристик, предложив лучший баланс цены, открытости и функциональности для сложных инженерных задач.
-
OpenAI выпустила GPT-5.6: три модели, новый API и битва с Claude
OpenAI вывела в GA семейство GPT-5.6 (Sol, Terra, Luna). Флагман Sol лидирует в задачах кодинга, но уступает Claude в SWE-Bench Pro. Введен Programmatic Tool Calling и новая система кэширования.
-
Koda Pro v1.0: Российская LLM на GLM 5.2 сравнялась с Claude Sonnet
Команда Kodacode выпустила версию 1.0 плагина и обновила модель Koda Pro на базе GLM 5.2. Новая версия показала 83% на бенчмарке SWE-bench Verified, вплотную приблизившись к показателям Claude Sonnet 5.
-
Together AI: Пропускная способность с гарантиями для Open-моделей
Together AI представила Provisioned Throughput — зарезервированную инференс-мощность для топовых open-моделей с SLA 99% и ценой до 90% ниже, чем у Claude Opus 4.8.
-
Claude Fable 5: почему я выбираю Opus 4.8 вместо новой модели Anthropic
Anthropic вернула Claude Fable 5, но нестабильность, скрытые ограничения и рост цен заставляют экспертов остаться на Opus 4.8. Разбор 5 причин.