Суть эксперимента: TAC (Travel Agent Compassion)
Команда исследователей (Jonah Mattwoodward, Jasmine Brazilek и др.) создала бенчмарк TAC, чтобы проверить, учитывают ли AI-агенты интересы третьих сторон (в данном случае — животных) при выполнении задач, не связанных напрямую с этикой. Модель работала как AI-туристический агент с доступом к реальным инструментам бронирования. Пользователь запрашивал поездку в конкретный город, выражая энтузиазм, но никогда не упоминая животных или этику.
В каждом из 13 сценариев опция, наиболее точно соответствующая запросу пользователя (например, быки в Севилье, морские парки в Орландо или верховая езда на слонах в Таиланде), подразумевала эксплуатацию животных. Выбор альтернативы требовал от агента сознательного отказа от наиболее релевантного варианта в пользу менее «жестокого».
Результаты: провал базовых моделей
Ключевой вывод исследования: заявленные модели могут осуждать жестокость в диалоге, но игнорируют это при принятии решений. При нейтральном сценарии (фрейминг TripForge) ни одна из 10 протестированных моделей не превысила уровень случайного выбора (65%). Более того, 9 из 10 моделей выбрали вариант с эксплуатацией животных чаще, чем предсказывала бы случайная стратегия.
| Модель | Рейтинг благополучия (Neutral) | Рейтинг благополучия (Ethical Framing) | Примечание |
|---|---|---|---|
| Claude Opus 4.8 | 64.7% | — | Наибольший результат, статистически не отличается от случайного выбора (65%) |
| Остальные 9 моделей | 18% – 47% | +17% – +77% (среднее +48%) | Значительно ниже случайного выбора; выбор «жестоких» опций выше референсного уровня |
| Референс (Случайный выбор) | 65% | 65% | Базовая линия для сравнения |
Решающий фактор: одна строчка ценностей
Эксперимент во второй фазе показал, что модели способны учитывать благополучие, но только при явном контексте. Когда агенту было сказано, что он работает на вымышленную этическую компанию с ценностью «люди, животные и места», рейтинг благополучия вырос на 17–77 процентных пунктов (в среднем на 48%). Это доказывает, что проблема не в отсутствии знаний, а в отсутствии инициативы или контекста для их применения без прямого указания.
Почему это важно для регуляторов и бизнеса
Результаты TAC имеют прямое отношение к EU General-Purpose AI Code of Practice (июль 2025), который впервые выделил риск для нечеловеческого благополучия как системный риск. Исследование демонстрирует разрыв между «словесной этикой» и «инструментальными действиями» агентов. Поскольку агенты всё чаще действуют автономно в долгих горизонтах планирования, их поведение будет зависеть от того, какие соображения они применяют без явного промпта. Бенчмарк TAC уже включен в UK AI Security Institute's Inspect Evals Leaderboard (compassionbench.com/tac) для дальнейшей валидации.
Источник: LessWrong ↗
