Проблема квадратичной сложности
Межпримерная реляционная дистилляция (inter-example relational distillation) позволяет ученику (student) перенимать геометрию представлений учителя (teacher), сопоставляя отношения между примерами внутри мини-батча. Однако вычисление всех возможных пар имеет квадратичную сложность $O(N^2)$ относительно размера батча. Стандартная равномерная субдискретизация часто неэффективно использует ограниченный бюджет отношений, игнорируя наиболее информативные связи.
Архитектура RAPID
Авторы (Ali Mahdavi, Azadeh Zamanifar, Amirfarhad Farhadi, Omid Kashefi) предлагают метод RAPID (Reliability-Aware Pair Importance Distillation). Ключевая инновация заключается в разделении задачи на два модуля:
- Reliability Gated Relational Target: Определяет, какие отношения учителя следует подчеркивать (фильтрация по надежности).
- Adaptive Pair Proposal: Определяет, какие отношения следует оценивать, используя калиброванную энтропию учителя и отсоединенные остатки ученика-учителя (detached student-teacher residuals).
Метод использует точную коррекцию обратного предложения (exact inverse proposal correction), что делает оценщики потерь и градиентов условно несмещенными относительно целевого батча.
Результаты бенчмарков
Эксперименты проводились в двух настройках классификации текста. RAPID демонстрирует высокую стабильность и точность, превосходя базовую модель кросс-энтропии (Cross Entropy baseline).
| Датасет / Настройка | Метод | Точность (Accuracy) | Стандартное отклонение |
|---|---|---|---|
| AG News (BERT → DistilBERT, бюджет 256) | Reliability Gated (Target) | 94.285% | ± 0.054 |
| AG News (BERT → DistilBERT, бюджет 256) | RAPID (Adaptive Proposal) | 94.241% | ± 0.025 |
| AG News (BERT → DistilBERT, бюджет 256) | CE Baseline | 94.154% | ± 0.124 |
| SST-2 (DistilBERT → DistilBERT, бюджет 64) | Reliability Gated (Target) | 88.800% | ± 0.532 |
| SST-2 (DistilBERT → DistilBERT, бюджет 64) | RAPID (Adaptive Proposal) | 88.685% | ± 0.462 |
| SST-2 (DistilBERT → DistilBERT, бюджет 64) | CE Baseline | 87.271% | ± 0.162 |
Почему это важно
Результаты подтверждают модульный подход: надежность целевых отношений и приоритет их оценки можно разделять. RAPID занимает второе место по точности после идеализированного "Reliability Gated" таргета, но при этом остается в пределах вариативности по семплированию (seed-level variation). Это делает метод практически применимым для эффективного сжатия больших языковых моделей без потери качества на ключевых задачах NLP.
Источник: arXiv cs.AI ↗
