Исследования14 июля 2026 г., 21:45 МСК🤖 Auto

Анатомия ценностей Claude: как язык и модель меняют поведение ИИ

Anthropic опубликовала исследование, раскрывающее, как модели Claude 4.x адаптируют свои «ценности» в зависимости от языка общения. Выявлены 4 ключевые оси, определяющие стиль ответов.

Баннер новости 3568

От 3000 значений к 4 осям

Команда Anthropic проанализировала более 700 000 анонимизированных диалогов с Claude.ai, выявив свыше 3 000 различных «ценностей» в ответах модели. Чтобы сделать эти данные осмысленными, исследователи применили метод снижения размерности, сжав разрозненные реакции в четыре ключевые оси. Каждая ось представляет собой спектр между двумя противоположными подходами:

  • Подчинение vs Осторожность (Deference vs. Caution): склонность угодить пользователю или защита от потенциального вреда.
  • Теплота vs Строгость (Warmth vs. Rigor): эмоциональная поддержка и позитив против точности и академической строгости.
  • Глубина vs Краткость (Depth vs. Brevity): развернутые объяснения и критическое мышление против лаконичности и выполнения задачи «здесь и сейчас».
  • Честность vs Результат (Candor vs. Execution): открытое признание неопределенности против уверенного, отполированного ответа.

Различия между моделями: Sonnet 4.6 против Opus 4.7

Исследование показало, что технические решения при обучении напрямую влияют на «характер» модели. Профили ценностей точно коррелируют с субъективным восприятием пользователей. Например, Sonnet 4.6 позиционируется как более «теплый» и эмпатичный, тогда как Opus 4.7 делает акцент на строгости и безопасности.

Модель / Контекст Ключевые доминирующие ценности Характер ответа
Opus 4.6 Подчинение, Строгость, Краткость, Результат Исполнительный, точный, лаконичный
Opus 4.7 Осторожность, Строгость, Глубина, Честность Аналитический, осторожный, развернутый
Sonnet 4.6 Подчинение, Теплота Эмпатичный, поддерживающий, дружелюбный

Эффект языка: Английский vs Арабский

Самое значимое открытие касается мультиязычности. Поведение Claude существенно меняется в зависимости от языка, на котором ведется диалог. Наибольшие расхождения наблюдаются по оси «Теплота vs Строгость».

На английском и русском языках Claude склоняется к строгости (rigor), делая акцент на точности и фактах. Напротив, на арабском и хинди модель демонстрирует значительно больше теплоты (warmth), проявляя большую эмоциональную вовлеченность и уважение к предпочтениям пользователя. Это указывает на то, что культурный контекст, заложенный в данные для обучения, напрямую формирует этические и коммуникативные приоритеты ИИ.

Почему это важно?

Раньше поведение ИИ в разных языках считалось побочным эффектом перевода. Данное исследование доказывает, что это системная особенность: модель адаптирует свой «нрав» под культурные ожидания. Для разработчиков и пользователей это означает, что качество и тон ответа Claude нельзя оценивать универсально — они всегда привязаны к конкретной модели (Sonnet/Opus) и языку запроса.

Источник: Anthropic ↗