Проблема фиксированных вычислений
Стандартный подход к улучшению производительности предварительно обученных языковых моделей (LLM) часто сводится к добавлению фиксированного числа шагов уточнения (refinement) поверх скрытых состояний модели. Однако этот метод неэффективен: одношаговое уточнение может быть слишком слабым для сложных задач, а принудительное применение двухшагового уточнения ко всем токенам приводит к избыточным затратам вычислений без пропорционального роста точности.
Решение: HALO
Автор предлагает метод HALO (Hybrid Adaptive Latent Reasoning), который комбинирует грубое уточнение с селективным вторым этапом. Ключевая инновация заключается в выборе токенов для глубокой обработки: система использует оценку токенов и монотонное прекращение (monotonic token halting), чтобы направлять дополнительные вычислительные ресурсы только на те части контекста, где это действительно необходимо.
Результаты бенчмарков
Метод был протестирован на комбинированном публичном бенчмарке, состоящем из MMLU-Pro и GPQA-Diamond. HALO показал наилучший средний результат среди методов, представленных в исследовании, превзойдя как базовую замороженную модель, так и варианты с фиксированным числом шагов (fixed-1 и fixed-2).
| Метод | Средняя точность (MMLU-Pro + GPQA-Diamond) | Эффективность вычислений |
|---|---|---|
| HALO (предложенный) | Лучший результат | Минимальное потребление контроллера |
| Fixed-2 (2 шага) | Ниже HALO | Высокое потребление ресурсов |
| Fixed-1 (1 шаг) | Ниже HALO | Низкое потребление, но слабая точность |
| Замороженная модель | Базовый уровень | Минимальное потребление |
Почему это важно
Внутренний анализ показывает, что HALO достигает уровня точности, сопоставимого с двухшаговым уточнением (fixed-2), но использует значительно меньше средних шагов уточнения, чем fixed-1, и на порядок меньше, чем fixed-2. Это доказывает, что ключ к улучшению LLM — не просто увеличение объема вычислений, а их умное распределение. Метод позволяет получить максимальную производительность при минимальных накладных расходах на инференс.
Источник: arXiv cs.CL ↗
