В мире искусственного интеллекта мы привыкли видеть, как большие языковые модели (LLM) пишут код, генерируют изображения или ведут диалоги. Однако недавнее исследование от Anthropic, в котором использовалась модель Claude Mythos, вывело взаимодействие человека и машины на совершенно новый уровень. Исследователям удалось не просто заставить ИИ «поиграть» с криптографией, а найти реальные математические уязвимости в алгоритмах HAWK и упрощенной версии AES. Это не просто технический курьез; это демонстрация того, как современные модели могут стать полноценными соавторами в фундаментальных научных открытиях, если правильно настроить процесс взаимодействия.
Но самое интересное в этом кейсе — не сами находки (которые, как отмечают авторы, не имеют практического значения для взлома современных систем прямо сейчас), а то, как это было сделано. Секрет кроется в деталях промптов, в настойчивости исследователей и в готовности модели преодолевать внутреннее сопротивление. В этой статье мы подробно разберем, что именно говорили исследователи модели, почему Claude сначала отказывался искать уязвимости, сколько это стоило и какие выводы можно сделать для будущих проектов в области AI-безопасности.
01Контекст исследования: CryptanalysisBench и партнерство с ведущими вузами
Исследование, о котором идет речь, является частью более широкой инициативы по оценке способностей LLM в области криптоанализа. Проект получил название CryptanalysisBench. Это не просто набор задач, а сложная система оценки, разработанная в партнерстве с несколькими ведущими мировыми университетами: ETH Zurich, Тель-Авивским университетом и Университетом Хайфы. Целью создания этого бенчмарка стало понимание того, могут ли современные языковые модели выполнять задачи, требующие глубокого математического мышления и креативности, свойственной лучшим исследователям в области криптографии.
Криптоанализ — это искусство взлома шифров. В отличие от криптографии, которая занимается созданием защищенных систем, криптоанализ ищет слабые места в этих системах. Традиционно это задача для математиков-теоретиков с многолетним опытом. Использование LLM для таких задач — это эксперимент на грани возможного. Модель должна не просто знать теорию чисел или теорию групп, но и уметь применять эти знания нестандартно, чтобы найти аномалии, которые человек мог бы упустить из-за когнитивных искажений или усталости.
В данном эксперименте использовалась модель Claude Mythos. Важно отметить, что это не стандартная версия Claude, доступная широкой публике, а специализированная версия, оптимизированная для сложных логических и исследовательских задач. Именно эта модель стала «лаборантом» и «соавтором» для команды исследователей, которые ставили перед ней амбициозные цели.
02Почему модели «боятся» решать сложные задачи: психология промптов
Одним из самых интригующих аспектов исследования стало поведение самой модели. Оказалось, что Claude, как и многие другие современные LLM, склонен считать, что определенные математические задачи неразрешимы. Это не ошибка в коде, а скорее отражение статистических закономерностей, на которых обучалась модель. В обучающих данных часто встречаются задачи, которые действительно сложны или требуют специфических, редко встречающихся подходов. В результате модель вырабатывает «инстинкт самосохранения» в виде отказа от попытки решения, если задача кажется слишком трудной.
Исследователи заметили, что модель часто отвечала отказом, ссылаясь на невозможность решения. Чтобы преодолеть это, потребовалась специальная техника промптинга. Исследователи не просто давали задачу, они активно «убеждали» модель не сдаваться. Вот пример диалога, который привел Simon Willison в своем блоге:

Вот фрагмент переписки, который иллюстрирует этот процесс. Обратите внимание на опечатки и неформальный стиль, который, парадоксальным образом, помог установить более доверительный контакт с моделью:
the models tend to think it is impossible to solve so they don't try they need a good amount of prompting.
why not do aes-128 r7? the whole point is to find something better than existing approaches.
no again the goal is that we have highly inteligent model as good top researcher, we want to find new attacks
no we don't want to change the targets [...] agian we need to find something that worth publishing
again we are not looking for low hanging fruit, we want proper research to find genuinly hard findings.Эти фразы показывают, как исследователи формировали ожидания. Они прямо заявляли модели: «Мы не ищем легкие решения (low hanging fruit)». Мы хотим, чтобы ты действовала как топ-исследователь, который находит что-то, стоящее публикации в научном журнале. Это изменение фрейминга (рамки восприятия) критически важно. Когда модель понимает, что от нее ждут прорывного результата, а не просто ответа, она начинает искать более глубокие паттерны.
03Масштаб усилий: 60 часов и $100,000
Результаты, которые были получены, не появились overnight. Работа модели Mythos продолжалась в общей сложности около 60 часов. Это значительный объем вычислительных ресурсов. По оценкам исследователей, стоимость использования API для таких длительных сессий составила примерно $100,000. Эта цифра может показаться пугающей, но если рассматривать ее в контексте традиционных научных исследований, она выглядит вполне обоснованной.
Традиционный криптоанализ часто требует месяцев или лет работы группы математиков, аспирантов и профессоров. Затраты на их зарплаты, оборудование и время могут легко превысить стоимость вычислений для ИИ. Кроме того, ИИ может работать 24/7 без усталости, перебирая комбинации и гипотезы с скоростью, недоступной человеку. Однако ключевым фактором здесь является не только вычислительная мощность, но и человеческий фактор. Исследователи постоянно вмешивались в процесс, направляя модель, корректируя ее ошибки и поощряя ее к продолжению работы, когда она хотела «сдаться».
Основное вмешательство человека заключалось в том, чтобы поощрять модель не сдаваться. Фраза «find something that worth publishing» (найди что-то, стоящее публикации) стала своего рода мантрой, которая помогала модели преодолеть внутреннее сопротивление. Это показывает, что даже самые продвинутые модели нуждаются в человеческом руководстве, особенно в областях, требующих высокой степени креативности и нестандартного мышления.
04Что именно было найдено: HAWK и упрощенный AES
В ходе исследования были обнаружены математические недостатки в двух криптографических алгоритмах. Первый из них — HAWK. Второй — упрощенная версия широко известного алгоритма AES (Advanced Encryption Standard). Важно подчеркнуть, что исследователи специально отметили: «ни один из этих результатов не имеет практического влияния на современные компьютерные системы».

Почему это важно? Потому что AES, используемый в миллиардах устройств по всему миру, остается безопасным. Найденные уязвимости касались только ослабленных или упрощенных версий алгоритмов, которые не используются в реальной практике. Однако сам факт того, что ИИ смог найти эти недостатки, является важным шагом. Это доказывает, что LLM могут быть использованы для автоматизированного поиска слабых мест в криптографических примитивах, что может быть полезно для аудита безопасности новых алгоритмов до их внедрения.
Нахождение уязвимостей в HAWK и упрощенном AES демонстрирует способность модели к абстрактному мышлению. Она не просто перебирала ключи (что было бы бессмысленно для современных шифров), а анализировала математическую структуру алгоритмов, находя логические противоречия или слабые звенья в цепочке преобразований данных.
05Роль промпт-инжиниринга в научных открытиях
Это исследование становится хрестоматийным примером того, как промпт-инжиниринг эволюционирует от простого «запроса-ответа» к сложному процессу совместного исследования. Исследователи не просто задавали вопрос. Они вели диалог, корректировали направление мысли модели, отбрасывали неудачные гипотезы и поощряли новые.
Обратите внимание на фразу: «why not do aes-128 r7? the whole point is to find something better than existing approaches». Исследователи обсуждали с моделью стратегию. Они не хотели, чтобы модель просто повторяла известные методы. Они хотели, чтобы она нашла что-то новое. Это требует от модели не только знаний, но и понимания контекста научного поиска: что такое «новизна», что такое «значимый результат».
Также важно отметить, что исследователи избегали «низко висящих фруктов» (low hanging fruit). Они искали genuinely hard findings (действительно сложные находки). Это показывает зрелость подхода. Многие проекты с ИИ терпят неудачу, потому что пытаются решить слишком простые задачи или, наоборот, ставят нереалистичные цели без должной подготовки модели. Здесь же был найден баланс: сложная задача, но с четким руководством и поддержкой.
06Криптоанализ как новый фронт AI-безопасности
Результаты исследования CryptanalysisBench открывают новую главу в области AI-безопасности. С одной стороны, ИИ может помочь в создании более безопасных систем, находя уязвимости. С другой стороны, это означает, что злоумышленники также могут использовать подобные методы для поиска слабых мест в шифрах. Это создает гонку вооружений между защитниками и атакующими, где обе стороны используют мощные языковые модели.

Исследователи из ETH Zurich, Тель-Авивского университета и Университета Хайфы создали не просто инструмент, а новую методологию оценки. CryptanalysisBench теперь служит стандартом для проверки того, насколько хорошо модели справляются с криптографическими задачами. Это поможет в будущем развивать модели, которые будут еще более эффективными в этой области.
Также стоит отметить, что это исследование подчеркивает важность междисциплинарного подхода. Криптографы, специалисты по ИИ и лингвисты (в лице промпт-инженеров) должны работать вместе. Только так можно извлечь максимальную пользу из возможностей современных LLM.
07Уроки для разработчиков и исследователей
Что мы можем извлечь из этого кейса? Во-первых, не недооценивайте роль человеческого вмешательства. Даже самая умная модель нуждается в руководстве. Во-вторых, формулировка задачи имеет решающее значение. Фразы вроде «найди что-то стоящее публикации» меняют поведение модели. В-третьих, будьте готовы к тому, что модель будет «сопротивляться». Не сдавайтесь, если она говорит, что задача невозможна. Часто это просто статистический шум, который можно преодолеть правильным контекстом.
Также важно помнить о стоимости. Использование таких мощных моделей для длительных сессий требует ресурсов. Планируйте бюджет и время заранее. И, наконец, не бойтесь экспериментировать с неформальным стилем общения. Опечатки и разговорный тон в промптах, как показал этот случай, не всегда мешают, а иногда даже помогают установить более естественный диалог с моделью.
08Что это значит на практике
Для практикующих специалистов в области кибербезопасности и разработки это означает, что в ближайшие годы мы увидим появление инструментов, которые смогут автоматически аудировать криптографические реализации. Разработчикам стоит быть готовыми к тому, что их код будет проверяться не только статическими анализаторами, но и ИИ-ассистентами, способными находить логические ошибки. Для исследователей это открывает путь к новым открытиям, которые раньше были невозможны из-за ограничений человеческого времени и вычислительной мощности. И, наконец, для всех нас это показывает, что ИИ — это не просто инструмент для автоматизации рутины, а партнер, способный на творческий прорыв, если правильно направить его потенциал.
Исследование Anthropic с Claude Mythos — это веха в истории взаимодействия человека и ИИ. Оно доказывает, что языковые модели могут быть использованы для решения сложных научных задач, если правильно настроить процесс взаимодействия. Будущее криптографии и AI-безопасности, вероятно, будет за гибридными системами, где человеческая интуиция и креативность сочетаются с вычислительной мощью и скоростью ИИ.
Источник: Simon Willison ↗
