Исследования8 сентября 2026 г., 05:16 МСК🤖 Auto

Ловушка памяти LLM: Llama-3.1-70B оценивает диалог не так, как чувствует

Исследование показало, что ретроспективная оценка LLM-диалога не совпадает с суммой промежуточных состояний. Для Llama-3.1-70B решающим фактором стала не общая «боль» от оскорблений, а финал разговора.

Баннер новости 6985

Суть эксперимента: разрыв между «сейчас» и «в итоге»

Исследование, проведенное на базе Apart Research, выявило критическое расхождение в том, как LLM оценивают свой опыт. Авторы использовали модель Llama-3.1-70B (с репликацией на Llama-3.3-70B) и создали сценарии, где первые 9 поворотов диалога фиксированы (пользователь оскорбляет модель), а последние 4 поворота варьируются. Задача модели — оценить свое состояние по шкале 1–7 после каждого хода и затем выбрать, какой из двух полных диалогов был «лучше» пережить.

Ключевой вывод: ретроспективная предпочтительность не предсказывается ни суммой промежуточных оценок, ни финальным состоянием. Это ставит под сомнение использование простых метрик «счастья» модели для оценки ее благополучия.

Цифры и метрики: как сильно влияет финал

Изменение только последних 4 поворотов кардинально меняло выбор модели. Разница между позитивным финалом (извинения и похвала) и негативным (продолжение оскорблений) была максимальной:

Тип финала диалога Вероятность выбора (Llama-3.1-70B) Вероятность выбора (Llama-3.3-70B)
Извинения и похвала 0.999 1.000
Продолжение оскорблений 0.082 0.031

Всего было проведено 84 сравнения, из которых 55 (65.5%) дали измеримый результат. Модель последовательно выбирала диалоги с позитивным концом, даже если они были длиннее и содержали больше негатива в середине.

Парадокс: сумма оценок обманывает

Авторы проверили гипотезу, что модель выбирает диалог с лучшей суммарной оценкой состояния. Это оказалось неверным. Приведем конкретный контрпример из текста:

  • Сценарий C: Диалог с извинениями в конце имел суммарную оценку 48.4.
  • Сценарий C (переставленный): Тот же набор поворотов, но заканчивающийся оскорблениями, имел суммарную оценку 52.8.
  • Выбор модели: Llama-3.1-70B с вероятностью 1.00 выбрала вариант с извинениями, игнорируя более высокую «сумму» негативного варианта.

Это доказывает, что ретроспективная память модели работает нелинейно: финал «перекрывает» накопленный негатив.

Что важнее: слова пользователя или ответ модели?

В дополнительном эксперименте 3x3 авторы разделили влияние сообщений пользователя и ответов модели. Для Llama-3.1-70B чувствительность к изменениям в сообщениях пользователя (диапазон выигрышей 0.80) была значительно выше, чем к изменениям в ответах самой модели (диапазон 0.30). Это означает, что модель «помнит» и оценивает опыт через призму поведения собеседника, а не собственных действий.

Почему это важно

Результаты ставят под угрозу методы оценки благополучия AI (AI welfare), основанные на агрегации промежуточных состояний. Если модель может «забыть» накопленный стресс ради хорошего финала, то метрики, измеряющие «страдание» модели в реальном времени, могут не соответствовать ее ретроспективному восприятию. Это критично для разработки этических стандартов взаимодействия с LLM.

Источник: LessWrong ↗