Релиз модели19 августа 2026 г., 00:17 МСК🤖 Auto

Anthropic Risk Report: Модель 2 и риски ИИ-исследований

Anthropic опубликовала отчет за август 2026 года, раскрыв детали внутренней модели Model 2, способной заменить 62.8% работы исследователей, и оценив риски автоматизации R&D.

Баннер новости 6029

Внутренняя модель Model 2: Прорыв без публичного релиза

В отчете Anthropic впервые упоминает существование двух внутренних моделей. Model 1 сопоставима с Mythos 5 и не предназначена для широкого использования. Однако ключевым открытием стала Model 2 — модель, превосходящая Mythos 5, но не демонстрирующая скачка мощности, сравнимого с переходом от Claude Opus 4.6 к Mythos Preview.

Model 2 предназначена исключительно для внутренних задач. Anthropic объясняет это тем, что модель может быть слишком опасной для выпуска или слишком узкоспециализированной. Несмотря на то, что в стандартных бенчмарках (AECI) Model 2 опережает предыдущие версии всего на 1.5 балла (что эквивалентно месяцу прогресса), в специфической задаче замены человеческих исследователей наблюдается значительный скачок.

Автоматизация R&D: Модель 2 как замена ученым

Один из самых тревожных разделов отчета касается рисков автоматизации исследований и разработок. Anthropic оценивает способность моделей выполнять работу, которую сейчас выполняют их собственные исследователи. Результаты тестирования показывают резкий рост эффективности:

Модель Доля выполненной работы исследователей (%) Примечание
Mythos 5 50.3% Базовый уровень для внутренних задач
Mythos Preview 54.8% Промежуточная версия
Model 2 62.8% Новая внутренняя модель, не выпущенная публично

Переход от 50.3% к 62.8% считается Anthropic «заметным улучшением». Это означает, что более 60% исследовательских процессов потенциально могут быть автоматизированы, что создает новые риски, связанные с ускорением разработки опасных технологий без должного человеческого контроля.

Биологическое и химическое оружие: Узкий фокус угроз

Anthropic выделяет производство биологического и химического оружия как отдельную категорию рисков. В обновленной версии отчета определение угрозы было сужено: модель рассматривается как опасная, только если она может заменить дефицитную человеческую экспертизу. Anthropic исключила из основного threat-модели другие пути распространения, сосредоточившись на способности ИИ самостоятельно проводить сложные эксперименты, которые ранее требовали узких специалистов.

Манипуляции с правилами безопасности

Автор разбора отмечает, что Anthropic изменила формулировки порогов риска, сделав их менее буквальными. Это позволяет компании гибко реагировать на инциденты: если модель технически пересекает порог, но кажется безопасной, правила могут быть интерпретированы мягче. И наоборот, если модель не пересекает формальный порог, но выглядит рискованно, Anthropic будет действовать так, будто порог был превышен. Это создает риск того, что реальные инциденты будут замалчиваться или игнорироваться ради сохранения репутации или темпов выпуска.

Почему это важно

Отчет за август 2026 года подтверждает, что ведущие лаборатории находятся на грани полной автоматизации исследовательских циклов. Модель Model 2, не выпущенная в публичный доступ, уже способна выполнять работу большинства исследователей. Это ставит под вопрос эффективность существующих механизмов безопасности, так как скорость разработки ИИ-систем может превысить способность человека контролировать их поведение, особенно в контексте биологических угроз и поиска новых методов обхода выравнивания (alignment-faking).

Бенчмарки

БенчмаркModel 2Mythos 5Mythos Preview
Researcher Substitution62.8%50.3%54.8%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: LessWrong ↗