Парадокс «родной почвы»: Qwen3 проиграл дома
Исследователи Антони Чолговски и Абель Ияседе провели стресс-тест трех открытых LLM на данных World Values Survey (волна 7), оценив соответствие 63 демографическим персонажам в трех странах. Использовалась метрика нормализованного расстояния Вассерштейна (W) для измерения расхождения между распределениями модели и реальными культурными ценностями.
Результаты опровергли стереотип о «национальном шовинизме» моделей. Китайская Qwen3-4B показала наихудший результат именно на своей домашней аудитории: W1 = 0.436 — максимальное значение расхождения во всей матрице тестов. Американская Gemma3-12B и польская Bielik-11B-v3 также не продемонстрировали явного преимущества для своих стран.
Эффективность LoRA: быстро, но неэффективно
Авторы применили целевое дообучение методом LoRA (Low-Rank Adaptation) на пяти «худших» персонажах. Процесс был экономичным: менее 1200 тренировочных пар и время обучения под 15 минут на одной GPU. Это дало статистически значимое улучшение для Bielik-11B (p_Bonf = 0.002, d = -4.4), снизив предвзятость на 16.8%.
Проблема «перетасовки» предвзятости
Главный вывод исследования пугающ: дообучение не устраняет культурный дисбаланс, а перераспределяет его. При анализе на уровне стран выяснилось, что после коррекции худшие персонажи Bielik-11B полностью сменились с американских на китайских пожилых людей. Пересечение между наборами данных до и после исправления составило 0%. Это означает, что модель просто «вылечила» одну проблему, создав другую.
Сводка метрик расхождения (Wasserstein Distance)
| Модель | Страна происхождения | Показатель расхождения (W) | Статус |
|---|---|---|---|
| Qwen3-4B | Китай | 0.436 (максимум в тесте) | Худшее понимание своей аудитории |
| Gemma3-12B | США | Информация недостаточна | Не доминирует в родной культуре |
| Bielik-11B-v3 | Польша | Снижение bias на 16.8% после LoRA | Улучшение, но смена «жертв» предвзятости |
Почему это важно
Это первое исследование, которое целенаправленно атакует «худшие» демографические группы через LoRA для смягчения кросс-культурной предвзятости. Выводы показывают, что простые методы дообучения на малых данных могут быть опасны: они создают иллюзию исправления проблемы, тогда как на самом деле смещают культурный дисбаланс на другие уязвимые группы. Для разработчиков это сигнал к необходимости более комплексных подходов к оценке безопасности (safety) и культурной адаптации LLM.
Источник: arXiv cs.CL ↗
