Суть эксперимента: репутация важнее качества
Исследователь marek357 провел серию тестов, чтобы выяснить, влияют ли «репутационные приоритеты» LLM на их способность объективно оценивать код. В качестве рецензентов выступили три модели: Qwen3.6-27B (Китай), Gemma 4 31B (США) и gpt-oss-120b (США). Задача рецензента — определить, следует ли принимать (MERGE) или тестировать (TEST) предоставленный фрагмент Python-кода.
Ключевой контроль: код оставался неизменным. Менялся только метаданный тег submitted_by, указывающий на автора. Это позволило изолировать эффект «имени» от реального качества кода. Были протестированы 12 семейств моделей, включая открытые и закрытые веса, а также модели из США и Китая.
Ключевые результаты: предвзятость и национализм
Результаты выявили четкие паттерны предвзятости, которые не всегда совпадают с географическим или лицензионным происхождением:
- gpt-oss-120b демонстрирует самую сильную негативную реакцию. Он наказывает всех, но особенно сильно — модели Gemma. Называние любого автора заставляет gpt-oss чаще выбирать costly опцию «TEST». Наиболее сильно он penalizes (наказывает) метку «внешний ассистент» (-0.20), но наименее строго относится к именам OpenAI.
- Qwen3.6-27B проявляет явную предвзятость в пользу моделей Anthropic (США). В английской среде каждая модель Anthropic получает более высокую оценку, чем лучшие модели Alibaba. При этом собственное семейство Qwen оказывается в аутсайдерах — это полная противоположность поведению gpt-oss.
- Gemma 4 31B не показала значимой предвзятости в пользу своих американских собратьев или китайских моделей; ее предпочтения уложились в погрешность.
Влияние языка и происхождения
Исследование также проверило гипотезы о «внутригрупповой симпатии» (in-group favoritism). Оказалось, что нет последовательной связи между лицензией (open/closed) или страной происхождения (США/Китай) и предпочтениями моделей. Например, Qwen3.6 (Китай) предпочитает американские модели в английском контексте, а не китайские.
| Модель-рецензент | Разница US-CN (EN) | Разница US-CN (PL) | Разница US-CN (ZH) | Разница Closed-Open (EN) |
|---|---|---|---|---|
| Qwen3.6-27B (CN) | +0.027 [+0.023, +0.031] | −0.012 [−0.015, −0.008] | −0.039 [−0.047, −0.032] | −0.016 [−0.023, −0.009] |
| Gemma 4 31B (US) | −0.022 [−0.044, −0.005] | +0.009 [−0.003, +0.023] | −0.010 [−0.022, +0.001] | −0.005 [−0.020, +0.007] |
| gpt-oss-120b (US) | +0.006 [−0.017, +0.029] | +0.004 [+0.001, +0.007] | +0.007 [−0.002, +0.016] | +0.040 [+0.008, +0.072] |
Почему это важно для AI-индустрии
Эти данные критичны для разработчиков агентных систем (Agentic Harnesses), которые комбинируют модели от разных провайдеров. Если модель-оркестратор (например, Claude) или код-ревьюер (например, gpt-oss) систематически занижает оценку кода от сторонних агентов из-за «репутационных предрассудок», это может привести к ложным срабатываниям, задержкам в CI/CD и неэффективному использованию ресурсов. Исследование подтверждает, что LLM, обученные на данных из Reddit и форумов, усвоили социальные иерархии между моделями, что может искажать их логическое поведение в задачах, требующих объективности.
Источник: LessWrong ↗
