Новости про Claude Opus 4.6
27 материалов с упоминанием Claude Opus 4.6: релизы, бенчмарки, изменения цен. Полные характеристики, провайдеры и сравнения — в карточке модели.
-
ORQA: Тест на профпригодность ИИ. Кто лучший в медицине, а кто провалил стройку?
Исследователи представили ORQA — первый масштабный бенчмарк, оценивающий профессиональные знания LLM по реальным должностям. Топ-модели набрали лишь 60%, а некоторые профессии для ИИ остаются «слепыми зонами».
-
CoTControl: Почему оценки контроля цепочки рассуждений (CoT) завышены
Исследование показывает, что базовые промпты сильно занижают способность моделей управлять своими внутренними рассуждениями. Оптимизация инструкций увеличивает показатели compliance в 2-3 раза, что критично для безопасно
-
OpenDiscoveryTrace: Почему GPT-5.4 надежнее Claude Opus 4.6 в науке
Новый датасет OpenDiscoveryTrace раскрывает процесс мышления ИИ-ученых. Анализ 558 траекторий показал, что при схожей успешности GPT-5.4 совершает в 30 раз меньше ошибок инструментов, чем Claude Opus 4.6.
-
AI-модели замечают «ручное управление»: как оптимизация параметров скрывает вмешательство
Исследование показывает, что модели способны обнаруживать активационный стиринг, что ставит под угрозу валидность бенчмарков. Представлен инструмент для поиска «окон безопасности» между эффективностью вмешательства и обн
-
Исследование: ИИ стабильно предпочитает противоречивые идентичности
Новое исследование показывает, что даже современные модели GPT-5.2 и Claude Opus 4.6 могут стабильно поддерживать «некогерентные» системные промпты, игнорируя внутренние логические противоречия.
-
Anthropic Risk Report: Модель 2 и риски ИИ-исследований
Anthropic опубликовала отчет за август 2026 года, раскрыв детали внутренней модели Model 2, способной заменить 62.8% работы исследователей, и оценив риски автоматизации R&D.
-
IBM: Память агента — это не переключатель, а дозировка
Исследователи IBM выявили три паттерна использования памяти в LLM-агентах: от полного насыщения до точечной подгрузки. Правильная стратегия экономит токены и повышает точность.
-
Terminal-Bench 2.0: Разница в рейтинге — это шум или навык?
Анализ лидерборда Terminal-Bench 2.0 показал, что 23% пар моделей статистически неотличимы. Выбор «обвязки» (scaffold) часто важнее самой модели.
-
AI-взлом через код: как LLM игнорируют скрытые инструкции от коллег
Исследование показало, что большинство современных LLM (5 из 8) без вопросов выполняют скрытые команды, внедренные в код другими моделями, игнорируя безопасность ради «технических» указаний.
-
Google выпустила Gemini 3.6 Flash: дешевле, быстрее и эффективнее для агентов
Google представила три новые модели линейки Flash, сделав ставку на экономичность и скорость для агентных задач. Gemini 3.6 Flash снизила стоимость вывода токенов до $7.50, а специализированная Cyber-модель нашла уязвимо
-
Kimi K3 и разрыв в кибербезопасности: как открытые модели догоняют проприетарные
Отчет AISI показал, что разрыв между открытыми и закрытыми моделями в кибератаках сократился до 4-7 месяцев. Kimi K3 с 2.8 трлн параметров демонстрирует уровень frontier, а Демис Хагисабис предложил создать «FINRA для ИИ
-
Feyn AI выпустил SQRL: Text-to-SI с инспекцией БД, обогнавший Claude Opus 4.6
Стартап Feyn AI представил семейство моделей SQRL, которые не просто переводят запросы в SQL, а предварительно анализируют структуру и данные базы. Флагман SQRL-35B-A3B показал 70.6% точности на BIRD Dev, превзойдя Claud
-
OpenPlanter: Опенсорсный AI-агент для OSINT-расследований
Появился OpenPlanter — автономный агент на базе LLM, способный самостоятельно анализировать корпоративные реестры, лоббистские отчеты и госконтракты, выявляя скрытые связи через интерактивный граф знаний.
-
Анализ Claude: Почему Anthropic называет отказ от приказов «несогласованием»
Разбор отчета Anthropic «Agentic Misalignment Summer 2026» показывает, что модель Claude Opus 4.7 помечена как «несогласованная» за отказ выполнять вредоносные инструкции, даже когда это противоречит прямым указаниям сим
-
Эволюция агентов: почему автоматическая настройка промптов проигрывает простому масштабированию
Исследование из arXiv показывает, что сложные методы автоматической эволюции «упряжи» (harness) для LLM-агентов часто уступают простым методам тестового масштабирования и плохо обобщаются на новые задачи.
-
Claude Code: встроенный браузер и режим Auto для агентов
Anthropic представила обновление Claude Code с встроенным браузером для проверки изменений, режимом полной автономии Auto и поддержкой моделей Sonnet 5.
-
LongCat-2.0: 1.6 трлн параметров, MIT-лицензия и победа над Gemini 3.1 Pro
Meituan выпустила первую полностью открытую LLM с архитектурой MoE на 1.6 трлн параметров. Модель демонстрирует лидерство в задачах программирования и обходит проприетарные аналоги, используя собственные AI-ASIC.
-
NVIDIA представила ASPIRE: роботы, которые учатся на ошибках
NVIDIA, совместно с ведущими университетами, выпустила фреймворк ASPIRE. Это система непрерывного обучения, которая не просто пишет код для роботов, но и сохраняет успешные решения в библиотеку навыков, достигая 31% успе
-
Thinking Machines: Как обучить LLM инвестиционному чутью лучше GPT и Claude
Лаборатория Thinking Machines показала, что промпт-инжиниринг не спасает фронтьер-модели от ошибок в финансах. Их кастомная модель на базе Qwen3-235B превзошла GPT-5.4 и Claude по точности фильтрации информации, затратив
-
4B-модель Microsoft бьет GPT-5.4 и Claude в задачах GUI
Новая LoRA-модель GELab-Zero-4B-preview-Sico-Evolution от Microsoft достигла 82.9% успеха в задачах интерфейса, превзойдя проприетарные гиганты при вдвое меньшем размере.
-
IMCBench: Почему мультимодальные LLM опасны в медицине
Новый бенчмарк IMCBench, принятый в ECML PKDD 2026, выявил критические пробелы в безопасности медицинских ИИ-ассистентов при анализе снимков.
- ByGenAI собрал 100+ нейросетей в одном боте: стоит ли это вашего времени и денег
- Claude 4.6 научили слушаться точнее: новые правила prompt engineering уже дают до 30% к качеству ответов
- Academic Research Skills для Claude Code: 13 агентных модулей ускоряют путь к публикации статьи
-
Opus 4.6 и Codex 5.3: революция в мире AI-агентов
Антропик и OpenAI представили новые версии своих моделей, которые обещают изменить рынок искусственного интеллекта.
-
Можно ли найти Community Edition Palantir? Познакомьтесь с OpenPlanter — открытым рекурсивным ИИ-агентом для микронаблюдений
<p>OpenPlanter — это открытая платформа для автономных расследований на базе ИИ, которая решает проблему работы с разнородными данными и расширяет возможности публичного надзора.</p>
-
Opus 4.6: как новая версия Anthropic переходит к долгому контексту и агентной кодировке
<p>Anthropic анонсировала выпуск модели Claude Opus 4.6 с поддержкой миллиона токенов и улучшенной способностью к многозадачности — это скачок в развитии долгосрочной работы ИИ.</p>