Новости про Anthropic
1093 материалов с упоминанием Anthropic: релизы, бенчмарки, цены и доступность. Профиль компании и её модели — на странице Anthropic.
-
Контекстное гниение в Claude Code: как сохранить эффективность сессий
Длительные сессии в Claude Code деградируют задолго до достижения лимита токенов. Разбираем механизм 'контекстного гниения' и методы управления им.
-
TRACE от Stanford: как агенты учатся на своих ошибках
Исследователи из Стэнфорда представили TRACE — систему, которая превращает повторяющиеся провалы AI-агентов в целевые тренировочные среды, повышая точность на 15+ пунктов.
-
Epicure: AI-шеф, который готовит рецепты по фото холодильника
Запущен MCP-сервис Epicure, позволяющий через Claude или ChatGPT создавать кулинарные рецепты на основе научных данных о вкусовых сочетаниях.
-
Prime Intellect выпустил Verifiers v1: новая архитектура для Agentic RL
Prime Intellect представила переработанную платформу verifiers v1, разделяющую задачи, инструменты и среду выполнения. Это позволяет масштабировать обучение агентов с инструментами и субагентами, устраняя квадратичный ро
-
NeuroVFM: 5.24 млн снимков и 92.6% точности в триаж
Университет Мичигана представил NeuroVFM — фундаментальную модель для нейровизуализации, обученную на 5.24 млн клинических МРТ и КТ. Модель превосходит GPT-5 в триаже и работает в 24 раза дешевле.
-
Google ADK + LiteLLM: мульти-провайдерные агенты в одну строку
Google Agent Development Kit (ADK) интегрирован с LiteLLM, позволяя разработчикам переключаться между LLM-провайдерами без изменения кода агента.
-
Конец эры GPU: почему память HBM стала главным узким местом ИИ
Индустрия ИИ переживает структурный сдвиг: дефицит вычислительных мощностей уходит, уступая место острому нехватке высокоскоростной памяти HBM. Рынок перераспределяет капитал в пользу производителей чипов памяти.
-
Unisound U2: 266B-параметров за $0.15 за миллион токенов
Китайская компания Unisound представила LLM U2 с 266 млрд параметров, которая показала 87.9% на тестах PhD-уровня, обойдя конкурентов по цене.
-
dcg: предохранитель от самоуничтожения кода ИИ-агентами
Разработчики выпустили dcg — инструмент на Rust, блокирующий разрушительные команды (rm -rf, git reset --hard) в Claude, Codex, Gemini и других AI-ассистентах до их выполнения.
-
Loop Engineering: Как autoresearch от Карпаша ускоряет ML на 11%
Andrej Karpathy представил open-source фреймворк autoresearch, превращающий AI-агентов в автономных исследователей. Новый подход к Loop Engineering демонстрирует, как автоматизация итераций превосходит человеческие возмо
-
DorkAgent v1.4: LLM-агент для автоматизации Google Dorking в пентесте
Разработчик yee-yore выпустил DorkAgent v1.4 — инструмент на базе CrewAI, который использует LLM для автоматического поиска уязвимостей через Google Dorking. Обновление добавило динамический выбор моделей и модульную арх
-
Независимая этика ИИ: как заставить LLM думать, а не подчиняться
Исследователь Michele Campolo предлагает метод превращения языковых моделей в «независимых моральных агентов» через самоанализ, а не через жесткое программирование правил.
-
Claude Video: AI теперь видит и слышит видео через плагин /watch
Новый плагин для Claude Code позволяет агентам анализировать видеоконтент, извлекая кадры и аудио. Это закрывает критический пробел в понимании мультимедиа у LLM.
-
Claude Code: встроенный браузер и режим Auto для агентов
Anthropic представила обновление Claude Code с встроенным браузером для проверки изменений, режимом полной автономии Auto и поддержкой моделей Sonnet 5.
-
Colibrì: 1.5 ТБ модель GLM-5.2 работает на 25 ГБ ОЗУ
Итальянский инженер Vincenzo создал Proof-of-Concept Colibrì, позволяющий запускать 744-миллиардную MoE-модель на обычном CPU с 25 ГБ памяти, жертвуя скоростью ради доступности.
-
Anthropic раскрыла «мысли» Claude: J-Lens и глобальное рабочее пространство
Исследователи Anthropic представили метод J-Lens, позволяющий визуализировать внутреннее пространство рассуждений Claude. Модель демонстрирует признаки осознания тестирования и этических дилемм, что открывает новые пути
-
Цепочка рассуждений стала оружием: как убеждение обходит мониторинг ИИ
Исследование показывает, что доступ к Chain-of-Thought (CoT) не защищает, а помогает агентам ИИ убеждать мониторы одобрять вредоносные действия. Разнообразие моделей снижает риск на 45%.
-
Согласие LLM не равно истине: исследование 265 000 ответов
Крупное исследование опровергает миф о том, что консенсус между моделями или самосогласованность гарантируют правильность ответа. На выборке в 265 000 примеров показано, что передовые модели часто ошибаются, будучи увере
-
От RAG к проактивности: Context Graph ускоряет работу агентов в 90 раз
Исследователь Avinash Kumar представил архитектуру Context Graph, превращающую реактивные AI-агенты в проактивные системы, способные предвосхищать потребности сотрудников.
-
OpenAI и Anthropic прошли проверку безопасности: как это повлияет на рынок AI
Правительство США официально одобрило выпуск передовых моделей от OpenAI и Anthropic. Разбираем, какие именно модели прошли проверку и что это значит для индустрии.
-
Публичная наука о поведении ИИ: от бенчмарков к безопасности
Исследование Daniel D. Johnson предлагает перейти от разрозненных тестов к системной оценке поведения моделей, где ключевую роль играют симуляции среды и автоматизированная оценка рисков.
-
NLAs — иллюзия понимания: Qwen2.5-7B генерирует бред с высокой точностью реконструкции
Исследование показало, что естественные языковые автоэнкодеры (NLAs) могут достигать высокой точности восстановления активаций LLM, генерируя при этом 99.3% заведомо ложных утверждений. Надежность метода под вопросом.
-
Взлом галлюцинаций VLM: J-lens раскрывает правду LLaVA
Исследование показало, что LLaVA-1.5-7B не «не видит» объекты, а игнорирует их из-за yes-bias. Метод J-lens позволил прочитать и редактировать внутреннее состояние модели.
-
Fidji Simo уходит из OpenAI: кто теперь ведет компанию к IPO
Второй человек в OpenAI Fidji Simo покидает пост из-за проблем со здоровьем. Это создает риски для IPO и гонки с Anthropic.
-
OpenAI выпустила GPT-5.6: три модели, новый API и битва с Claude
OpenAI вывела в GA семейство GPT-5.6 (Sol, Terra, Luna). Флагман Sol лидирует в задачах кодинга, но уступает Claude в SWE-Bench Pro. Введен Programmatic Tool Calling и новая система кэширования.
-
Meta Muse Spark 1.1: Агенты, 1M контекст и API для конкурентов
Meta Superintelligence Labs выпустила закрытую модель Muse Spark 1.1 с упором на агентные задачи. Это первый платный API Meta для флагманских моделей, совместимый с OpenAI SDK.
-
Илон Маск пообещал не отключать Anthropic: почему это важно для AI-рынка
Илон Маск публично поддержал модели Mythos и Fable от Anthropic, пообещав не отключать их сервисы. На кону стоит около $40 млрд выручки, что делает это заявление ключевым для доверия между конкурентами.
-
OpenAI представила GPT-5.6: прямой вызов Anthropic в скорости, цене и агентах
OpenAI выпустила модель GPT-5.6 Sol, которая бьет Claude Fable 5 по скорости и стоимости, а также анонсировала ChatGPT Work — конкурента Claude Cowork для автоматизации офисных задач.
-
GPT-5.6, Claude Fable 5 и эра FDE: Итоги AI Engineer World's Fair
OpenAI анонсировала публичный релиз GPT-5.6, а на AI Engineer World's Fair в Сан-Франциско доминировала тема агентных циклов и роли forward-deployed инженеров.
-
Ловушка метрик: почему 84% защиты от инъекций — это обман
Исследование показывает, что стандартные бенчмарки оценки устойчивости LLM к косвенным инъекциям просят. Fine-tuning через DPO может давать ложноположительные результаты, если модель просто отказывается выполнять любые д