Исследования1 сентября 2026 г., 08:17 МСК🤖 Auto

TPvG: Как обратная связь меняет моральный выбор LLM

Исследователи представили TPvG — новую фреймворк для оценки морали LLM, показавший, что модели ведут себя иначе людей при получении обратной связи о последствиях их решений.

Баннер новости 6470

Проблема однократных тестов

Существующие методы оценки морали больших языковых моделей (LLM) часто сводятся к представлению изолированных этических дилемм и получению однократного решения. Этот подход игнорирует ключевой фактор, влияющий на человеческое поведение — обратную связь о последствиях (consequence feedback). Исследователи Fangyuan Zhang, Dong Yu и Pengyuan Liu из Университета Цинхуа (Tsinghua University) предлагают решение этой проблемы через новый фреймворк TPvG (Text-based Pain-versus-Gain).

Суть фреймворка TPvG

TPvG адаптирован из человеческой парадигмы морального выбора, где сталкиваются два импульса: не причинять вред другим и максимизировать собственную выгоду. Фреймворк включает пять задач, которые прогрессируют от минимального контекста (однократный выбор) до последовательных решений с явной обратной связью от «жертвы» или «получателя» решения. Это позволяет модели видеть, как её действия влияют на других в динамике.

Ключевые результаты: Разрыв с человеческой логикой

Эксперименты показали, что формат принятия решения (однократный vs последовательный) сильно влияет на выбор LLM. Однако самое важное открытие заключается в том, что реакции моделей на явную обратную связь от получателя расходятся с человеческими паттернами. Это указывает на то, что внутренние процессы принятия моральных решений у LLM фундаментально отличаются от человеческих.

Параметр Описание в исследовании
Название фреймворка TPvG (Text-based Pain-versus-Gain)
Авторы Fangyuan Zhang, Dong Yu, Pengyuan Liu
Дата публикации 15 июля 2026 (arXiv:2608.28610)
Количество задач 5 (от однократных до последовательных с фидбеком)
Главный вывод LLM демонстрируют гетерогенные эффекты от обратной связи и отклоняются от человеческих моральных паттернов

Почему это важно для индустрии

Результаты подчеркивают необходимость пересмотра подходов к тестированию ИИ. Если модели ведут себя нестабильно или неэтично в условиях высокой ответственности и интерактивности (где есть последствия), текущие бенчмарки не способны это выявить. Исследование призывает к созданию более сложных, интерактивных сред для оценки безопасности LLM, а не просто к статическим опросам.

Источник: arXiv cs.AI ↗