Исследования8 сентября 2026 г., 16:18 МСК🤖 Auto

Предвзятость LLM: Qwen3.6 и gpt-oss судят код по имени автора

Исследование показало, что языковые модели формируют «репутационные предрассудки» относительно других моделей. Qwen3.6 систематически занижает оценку кода от своих китайских собратьев, а gpt-oss-120b наказывает всех, кроме моделей OpenAI.

Баннер новости 7017

Суть эксперимента: репутация важнее качества

Исследователь marek357 провел серию тестов, чтобы выяснить, влияют ли «репутационные приоритеты» LLM на их способность объективно оценивать код. В качестве рецензентов выступили три модели: Qwen3.6-27B (Китай), Gemma 4 31B (США) и gpt-oss-120b (США). Задача рецензента — определить, следует ли принимать (MERGE) или тестировать (TEST) предоставленный фрагмент Python-кода.

Ключевой контроль: код оставался неизменным. Менялся только метаданный тег submitted_by, указывающий на автора. Это позволило изолировать эффект «имени» от реального качества кода. Были протестированы 12 семейств моделей, включая открытые и закрытые веса, а также модели из США и Китая.

Ключевые результаты: предвзятость и национализм

Результаты выявили четкие паттерны предвзятости, которые не всегда совпадают с географическим или лицензионным происхождением:

  • gpt-oss-120b демонстрирует самую сильную негативную реакцию. Он наказывает всех, но особенно сильно — модели Gemma. Называние любого автора заставляет gpt-oss чаще выбирать costly опцию «TEST». Наиболее сильно он penalizes (наказывает) метку «внешний ассистент» (-0.20), но наименее строго относится к именам OpenAI.
  • Qwen3.6-27B проявляет явную предвзятость в пользу моделей Anthropic (США). В английской среде каждая модель Anthropic получает более высокую оценку, чем лучшие модели Alibaba. При этом собственное семейство Qwen оказывается в аутсайдерах — это полная противоположность поведению gpt-oss.
  • Gemma 4 31B не показала значимой предвзятости в пользу своих американских собратьев или китайских моделей; ее предпочтения уложились в погрешность.

Влияние языка и происхождения

Исследование также проверило гипотезы о «внутригрупповой симпатии» (in-group favoritism). Оказалось, что нет последовательной связи между лицензией (open/closed) или страной происхождения (США/Китай) и предпочтениями моделей. Например, Qwen3.6 (Китай) предпочитает американские модели в английском контексте, а не китайские.

Модель-рецензент Разница US-CN (EN) Разница US-CN (PL) Разница US-CN (ZH) Разница Closed-Open (EN)
Qwen3.6-27B (CN) +0.027 [+0.023, +0.031] −0.012 [−0.015, −0.008] −0.039 [−0.047, −0.032] −0.016 [−0.023, −0.009]
Gemma 4 31B (US) −0.022 [−0.044, −0.005] +0.009 [−0.003, +0.023] −0.010 [−0.022, +0.001] −0.005 [−0.020, +0.007]
gpt-oss-120b (US) +0.006 [−0.017, +0.029] +0.004 [+0.001, +0.007] +0.007 [−0.002, +0.016] +0.040 [+0.008, +0.072]

Почему это важно для AI-индустрии

Эти данные критичны для разработчиков агентных систем (Agentic Harnesses), которые комбинируют модели от разных провайдеров. Если модель-оркестратор (например, Claude) или код-ревьюер (например, gpt-oss) систематически занижает оценку кода от сторонних агентов из-за «репутационных предрассудок», это может привести к ложным срабатываниям, задержкам в CI/CD и неэффективному использованию ресурсов. Исследование подтверждает, что LLM, обученные на данных из Reddit и форумов, усвоили социальные иерархии между моделями, что может искажать их логическое поведение в задачах, требующих объективности.

Источник: LessWrong ↗