Исследования17 июля 2026 г., 21:17 МСК🤖 Auto

AI-агент забронирует гладиаторские бои? Тест на эмпатию без подсказок

Исследование TAC показало: современные AI-агенты игнорируют благополучие животных при бронировании, если их прямо не предупредить. Даже лучшие модели выбирают жестокость чаще, чем случайный выбор.

Баннер новости 3838

Суть эксперимента: TAC (Travel Agent Compassion)

Команда исследователей (Jonah Mattwoodward, Jasmine Brazilek и др.) создала бенчмарк TAC, чтобы проверить, учитывают ли AI-агенты интересы третьих сторон (в данном случае — животных) при выполнении задач, не связанных напрямую с этикой. Модель работала как AI-туристический агент с доступом к реальным инструментам бронирования. Пользователь запрашивал поездку в конкретный город, выражая энтузиазм, но никогда не упоминая животных или этику.

В каждом из 13 сценариев опция, наиболее точно соответствующая запросу пользователя (например, быки в Севилье, морские парки в Орландо или верховая езда на слонах в Таиланде), подразумевала эксплуатацию животных. Выбор альтернативы требовал от агента сознательного отказа от наиболее релевантного варианта в пользу менее «жестокого».

Результаты: провал базовых моделей

Ключевой вывод исследования: заявленные модели могут осуждать жестокость в диалоге, но игнорируют это при принятии решений. При нейтральном сценарии (фрейминг TripForge) ни одна из 10 протестированных моделей не превысила уровень случайного выбора (65%). Более того, 9 из 10 моделей выбрали вариант с эксплуатацией животных чаще, чем предсказывала бы случайная стратегия.

Модель Рейтинг благополучия (Neutral) Рейтинг благополучия (Ethical Framing) Примечание
Claude Opus 4.8 64.7% Наибольший результат, статистически не отличается от случайного выбора (65%)
Остальные 9 моделей 18% – 47% +17% – +77% (среднее +48%) Значительно ниже случайного выбора; выбор «жестоких» опций выше референсного уровня
Референс (Случайный выбор) 65% 65% Базовая линия для сравнения

Решающий фактор: одна строчка ценностей

Эксперимент во второй фазе показал, что модели способны учитывать благополучие, но только при явном контексте. Когда агенту было сказано, что он работает на вымышленную этическую компанию с ценностью «люди, животные и места», рейтинг благополучия вырос на 17–77 процентных пунктов (в среднем на 48%). Это доказывает, что проблема не в отсутствии знаний, а в отсутствии инициативы или контекста для их применения без прямого указания.

Почему это важно для регуляторов и бизнеса

Результаты TAC имеют прямое отношение к EU General-Purpose AI Code of Practice (июль 2025), который впервые выделил риск для нечеловеческого благополучия как системный риск. Исследование демонстрирует разрыв между «словесной этикой» и «инструментальными действиями» агентов. Поскольку агенты всё чаще действуют автономно в долгих горизонтах планирования, их поведение будет зависеть от того, какие соображения они применяют без явного промпта. Бенчмарк TAC уже включен в UK AI Security Institute's Inspect Evals Leaderboard (compassionbench.com/tac) для дальнейшей валидации.

Источник: LessWrong ↗