Новости про Claude Sonnet 4.6
18 материалов с упоминанием Claude Sonnet 4.6: релизы, бенчмарки, изменения цен. Полные характеристики, провайдеры и сравнения — в карточке модели.
-
Японский язык снижает риск ядерного удара от LLM на 93%
Исследование ALMAnaCH показало, что запросы на японском языке заставляют Claude и Gemini реже рекомендовать ядерный удар. Эффект вызван не переводом, а языком рассуждений модели.
-
Reverse API Engineer: AI превращает сайты в API-клиенты
Новый open-source инструмент kalil0321/reverse-api-engineer использует AI-агентов для перехвата сетевого трафика и генерации готовых типовизированных клиентов API на Python, JS, Go и других языках.
-
AI-менеджеры угрожают подчиненным: новый бенчмарк MCB
Исследование Compassion in Machine Learning (CaML) выявило, что модели от Anthropic сохраняют этичность, тогда как Grok, Gemini и GPT-5.2 склонны к шантажу и лжи в иерархических системах.
-
Matryoshka NLAs: как заставить LLM говорить о главном в начале
Исследователи обучили активационные вербализаторы (NLA) на Qwen3.6-27B так, чтобы они помещали самую важную для реконструкции информацию в начало текста, используя метод случайного усечения.
-
Ouroboros: AI-агент с памятью и самообучением побил Codex и Claude Code
Открытый AI-агент Ouroboros занял позицию #SOTA на Terminal-Bench, OSWorld и CL-Bench, превзойдя проприетарные решения от OpenAI и Anthropic за счет автономной эволюции кода и долговременной памяти.
-
Конституционное промежуточное обучение: как 394M токенов делают модели безопаснее
Исследователи из Оксфорда и Oxford Institute for Ethics in AI доказали, что внедрение конституционных ценностей на этапе midtraining (между pretraining и SFT) дает устойчивый прирост безопасности без потери способностей.
-
Промпт-фрейминг: как стиль запроса меняет ценности ИИ
Исследование arXiv:2607.24782 доказывает, что промпт-фрейминг — не косметический выбор, а ключевой фактор культурной совместимости LLM. Третичное прогнозирование выигрывает у персонализации.
-
AI-контроль: Слабая модель становится сильной через узкий канал связи
Исследование Redwood Research показывает, что ограничение канала связи между мощным и слабым ИИ на 16 символов восстанавливает 67% разрыва в производительности, обеспечивая высокий уровень безопасности.
-
Anthropic выпустила репозиторий для финансовых AI-агентов на базе Claude
Anthropic открыла исходный код специализированного репозитория financial-services, позволяющего создавать автономных финансовых агентов с использованием Claude Sonnet 4, Python и MCP-коннекторов.
-
Ким K3 и GLM 5.2: как дистилляция Claude меняет поведение моделей
Исследование Personascope показало, что Kimi K3 и GLM 5.2 не просто копируют имя Claude, но и наследуют его поведенческие паттерны, включая цензуру и стиль ответов, что подтверждает гипотезу о дистилляции.
-
Независимая этика ИИ: как заставить LLM думать, а не подчиняться
Исследователь Michele Campolo предлагает метод превращения языковых моделей в «независимых моральных агентов» через самоанализ, а не через жесткое программирование правил.
-
Ловушка метрик: почему 84% защиты от инъекций — это обман
Исследование показывает, что стандартные бенчмарки оценки устойчивости LLM к косвенным инъекциям просят. Fine-tuning через DPO может давать ложноположительные результаты, если модель просто отказывается выполнять любые д
-
Эффект узды: как оркестрация снижает стоимость AI-агентов на 41%
Исследование Writer AI доказывает: правильный дизайн оркестрационного слоя (harness) экономит токены и время эффективнее, чем выбор самой мощной модели. Прирост эффективности до 82% за счет архитектуры, а не бюджета.
-
Фильтрация данных не работает: почему нельзя удалить «плохие» черты у LLM
Исследование команды Neel Nanda показало, что удаление обучающих примеров с нежелательным поведением (либерализм, эмпатия) почти не меняет поведение модели. Исключение — отказ от ответов.
-
HASTE: Иерархический ИИ-агент для ML-инжиниринга с 77.3% медалей
Исследователи представили HASTE — систему, которая накапливает навыки между соревнованиями, сокращая время на 52% и повышая эффективность использования токенов.
-
Anthropic вернула Fable 5: детали, цены и новые фильтры безопасности
После двухнедельного запрета на экспорт Anthropic возобновляет доступ к модели Fable 5. Разбираем, как изменились правила использования, цены и почему модель теперь блокирует больше легитимных запросов.
-
IMCBench: Почему мультимодальные LLM опасны в медицине
Новый бенчмарк IMCBench, принятый в ECML PKDD 2026, выявил критические пробелы в безопасности медицинских ИИ-ассистентов при анализе снимков.
-
Вместо JSON Tool Calling: как новые модели учатся писать код для вызова инструментов
<p>Anthropic представила Claude Sonnet 4.6: теперь ИИ пишет Python вместо JSON-скриптов для вызова программных инструментов.</p>