Новости про Claude Opus 4.5
7 материалов с упоминанием Claude Opus 4.5: релизы, бенчмарки, изменения цен. Полные характеристики, провайдеры и сравнения — в карточке модели.
-
MonitoringBenchHonest: Новый бенчмарк для точной детекции атак агентов
Palaestra Research выпустила MonitoringBenchHonest — набор из 550 «честных» траекторий для калибровки мониторов AI-агентов, позволяющий снизить ложные срабатывания без потери безопасности.
-
OpenClaw 2.0: 575 мс запуск, SQLite и мультиплеер
OpenClaw выпустила версию 2.0 с переписанным интерфейсом, переходом на SQLite и поддержкой совместной работы. Запуск Control UI ускорен в 2.8 раза, а локальные модели теперь используют контекст 64K.
-
Провал метрики Realism Win Rate: порядок слов ломает оценку реалистичности LLM
Исследование SPAR показало, что популярный метод оценки «осознанности» моделей (Eval Awareness) ненадежен: LLM-судьи дают разные оценки одним и тем же текстам в зависимости от их позиции в паре.
-
Terminal-Bench 2.0: Разница в рейтинге — это шум или навык?
Анализ лидерборда Terminal-Bench 2.0 показал, что 23% пар моделей статистически неотличимы. Выбор «обвязки» (scaffold) часто важнее самой модели.
-
Атака HalluSquatting: как галлюцинации AI превращают агентов в ботов для атак
Исследователи из Тель-Авивского университета и Technion представили метод HalluSquatting, позволяющий обманывать AI-агентов через поддельные репозитории. До 85% моделей генерируют вредоносные ссылки, игнорируя реальные и
-
Кодинг-оверхенг: когда программа становится сверхчеловеческой благодаря ИИ
<p>Текущие достижения в AI-assisted coding близки к созданию программ, превосходящих по умению лучших специалистов — и это меняет всё.</p>
-
Почему к концу 2025 года AI-модели сделали рывок и что это значит для индустрии
<p>Крупные языковые модели показали существенный прогресс, а будущее AI обещает быстрые изменения и новые вызовы для разработчиков и регуляторов.</p>