Исследования4 августа 2026 г., 04:17 МСК🤖 Auto

ZeroR@CHiPSAL 2026: Qwen3-VL-8B победил в классификации непальских мемов

Исследователь Nitiz Khanal представил систему ZeroR, занявшую 2-е место на задаче обнаружения ненависти в непальских мемах, используя двухэтапную адаптацию Qwen3-VL-8B.

Баннер новости 5005

Решение проблемы низкоресурсных языков

На воркшопе CHiPSAL 2026 (в рамках LREC 2026) была представлена система ZeroR, разработанная для мультимодального анализа непальских мемов. Основная сложность задачи заключалась в обработке текста на языке Непали (шрифт Деванагари) в сочетании с визуальным контекстом. Авторы отказались от традиционного конвейера OCR и перевода, сделав ставку на нативную поддержку Деванагари в модели Qwen3-VL-8B-Instruct.

Двухэтапный пайплайн обучения

Архитектура ZeroR использует стратегию двухэтапной адаптации (Two-Stage Vision-Language Adaptation) для повышения точности классификации:

  • Этап 1 (Генеративная классификация): Применение LoRA-тюнинга с проекционной головой MLP (Multi-Layer Perceptron). Это позволяет модели генерировать вероятности токенов, соответствующих классам.
  • Этап 2 (Контрастное обучение): Тюнинг бэкбона с использованием супервизированной функции потерь InfoNCE. Это улучшает разделение классов в векторном пространстве.

Борьба с дисбалансом данных

Для решения проблемы дисбаланса классов (когда примеров ненависти или определенных настроений меньше) авторы применили комбинацию методов:

  • Досамплинг меньшинства (oversampling minority classes).
  • Аугментация изображений.
  • Использование функции потерь Focal Loss, которая фокусируется на сложных для классификации примерах.

Результаты и метрики

Система демонстрирует высокую эффективность, особенно в задаче обнаружения токсичности. Итоговые результаты на тестовой выборке CHiPSAL 2026:

Задача Метрика (F1-Score) Место в рейтинге
Обнаружение ненависти (Binary Hate Speech) 0.797 2-е место
Анализ тональности (3 класса) 0.518 4-е место

На этапе инференса (вывода) результаты первого этапа (токенные вероятности) и второго этапа (оценки классификатора) объединяются через ансамблирование с весами, настроенными на валидационной выборке. Такой подход позволил устранить ошибки, возникающие при раздельном использовании OCR и переводчиков, что критично для низкоресурсных языков Юго-Восточной Азии.

Источник: arXiv cs.CL ↗