Проблема узкого специализированного применения
Хотя крупные языковые модели (LLM) уже демонстрируют выдающиеся результаты в общем математическом рассуждении, их применение к сложным задачам обработки сигналов остается слабо изученным. Авторы работы SignalReasoner решили проверить, насколько эффективно можно адаптировать компактную модель Qwen2.5-3B-Base для решения задач уровня магистратуры из бенчмарка WirelessMATHBench-XL. Ключевой вопрос заключался в том, помогает ли предварительное обучение с учителем (SFT) на цепочках рассуждений (CoT) сделать последующее обучение с подкреплением (RL) более стабильным и точным.
Методология: сравнение стратегий оптимизации
Исследование протестировало два основных подхода к дообучению:
- Прямое RL: Обучение с подкреплением на датасете WirelessMATHBench-XL с верифицируемыми наградами.
- SFT + RL: Предварительное обучение с учителем на дистиллированном корпусе цепочек рассуждений (CoT) для беспроводных доменов, за которым следует тот же этап RL.
Для оптимизации политик использовались три алгоритма: GRPO (Group Relative Policy Optimization), GSPO (Group Sequence Policy Optimization) и GMPO (Geometric-Mean Policy Optimization). Целью было выявить, какие методы обеспечивают лучшую стабильность и точность именно для сигнальных задач.
Результаты: прорыв точности
Базовая модель Qwen2.5-3B-Base без дообучения показывала крайне низкий результат — всего 12.37% точности. После применения оптимальной стратегии дообучения (SFT + RL) удалось достичь точности в 39.12%. Это означает более чем трехкратное улучшение способности модели к математическому рассуждению в узкой предметной области.
| Метрика / Модель | Значение | Примечание |
|---|---|---|
| Базовая точность (Base) | 12.37% | Qwen2.5-3B без дообучения |
| Лучшая точность (Best) | 39.12% | После SFT + RL оптимизации |
| Улучшение | >3x | Относительный прирост точности |
| Бенчмарк | WirelessMATHBench-XL | Задачи уровня магистратуры |
Значение для индустрии
Результаты SignalReasoner доказывают, что даже модели с небольшим количеством параметров (3 миллиарда) могут стать эффективными инструментами для инженерных задач, если их правильно подготовить. Использование доменно-специфичных цепочек рассуждений (CoT) в качестве начальной точки для RL-оптимизации оказалось критически важным шагом. Это открывает путь к созданию легких, специализированных AI-ассистентов для телекоммуникаций и обработки сигналов, которые не требуют огромных вычислительных ресурсов для инференса.
Источник: arXiv cs.AI ↗
