От 3000 значений к 4 осям
Команда Anthropic проанализировала более 700 000 анонимизированных диалогов с Claude.ai, выявив свыше 3 000 различных «ценностей» в ответах модели. Чтобы сделать эти данные осмысленными, исследователи применили метод снижения размерности, сжав разрозненные реакции в четыре ключевые оси. Каждая ось представляет собой спектр между двумя противоположными подходами:
- Подчинение vs Осторожность (Deference vs. Caution): склонность угодить пользователю или защита от потенциального вреда.
- Теплота vs Строгость (Warmth vs. Rigor): эмоциональная поддержка и позитив против точности и академической строгости.
- Глубина vs Краткость (Depth vs. Brevity): развернутые объяснения и критическое мышление против лаконичности и выполнения задачи «здесь и сейчас».
- Честность vs Результат (Candor vs. Execution): открытое признание неопределенности против уверенного, отполированного ответа.
Различия между моделями: Sonnet 4.6 против Opus 4.7
Исследование показало, что технические решения при обучении напрямую влияют на «характер» модели. Профили ценностей точно коррелируют с субъективным восприятием пользователей. Например, Sonnet 4.6 позиционируется как более «теплый» и эмпатичный, тогда как Opus 4.7 делает акцент на строгости и безопасности.
| Модель / Контекст | Ключевые доминирующие ценности | Характер ответа |
|---|---|---|
| Opus 4.6 | Подчинение, Строгость, Краткость, Результат | Исполнительный, точный, лаконичный |
| Opus 4.7 | Осторожность, Строгость, Глубина, Честность | Аналитический, осторожный, развернутый |
| Sonnet 4.6 | Подчинение, Теплота | Эмпатичный, поддерживающий, дружелюбный |
Эффект языка: Английский vs Арабский
Самое значимое открытие касается мультиязычности. Поведение Claude существенно меняется в зависимости от языка, на котором ведется диалог. Наибольшие расхождения наблюдаются по оси «Теплота vs Строгость».
На английском и русском языках Claude склоняется к строгости (rigor), делая акцент на точности и фактах. Напротив, на арабском и хинди модель демонстрирует значительно больше теплоты (warmth), проявляя большую эмоциональную вовлеченность и уважение к предпочтениям пользователя. Это указывает на то, что культурный контекст, заложенный в данные для обучения, напрямую формирует этические и коммуникативные приоритеты ИИ.
Почему это важно?
Раньше поведение ИИ в разных языках считалось побочным эффектом перевода. Данное исследование доказывает, что это системная особенность: модель адаптирует свой «нрав» под культурные ожидания. Для разработчиков и пользователей это означает, что качество и тон ответа Claude нельзя оценивать универсально — они всегда привязаны к конкретной модели (Sonnet/Opus) и языку запроса.
Источник: Anthropic ↗
