Исследования20 августа 2026 г., 03:19 МСК🤖 Auto

SignalReasoner: 3B-модель решает задачи обработки сигналов лучше базы в 3 раза

Исследование Guozheng Sun показывает, как дообучение Qwen2.5-3B на специализированных данных и RL-оптимизация выводит точность решения математических задач в области обработки сигналов с 12% до 39%.

Баннер новости 6122

Проблема узкого специализированного применения

Хотя крупные языковые модели (LLM) уже демонстрируют выдающиеся результаты в общем математическом рассуждении, их применение к сложным задачам обработки сигналов остается слабо изученным. Авторы работы SignalReasoner решили проверить, насколько эффективно можно адаптировать компактную модель Qwen2.5-3B-Base для решения задач уровня магистратуры из бенчмарка WirelessMATHBench-XL. Ключевой вопрос заключался в том, помогает ли предварительное обучение с учителем (SFT) на цепочках рассуждений (CoT) сделать последующее обучение с подкреплением (RL) более стабильным и точным.

Методология: сравнение стратегий оптимизации

Исследование протестировало два основных подхода к дообучению:

  • Прямое RL: Обучение с подкреплением на датасете WirelessMATHBench-XL с верифицируемыми наградами.
  • SFT + RL: Предварительное обучение с учителем на дистиллированном корпусе цепочек рассуждений (CoT) для беспроводных доменов, за которым следует тот же этап RL.

Для оптимизации политик использовались три алгоритма: GRPO (Group Relative Policy Optimization), GSPO (Group Sequence Policy Optimization) и GMPO (Geometric-Mean Policy Optimization). Целью было выявить, какие методы обеспечивают лучшую стабильность и точность именно для сигнальных задач.

Результаты: прорыв точности

Базовая модель Qwen2.5-3B-Base без дообучения показывала крайне низкий результат — всего 12.37% точности. После применения оптимальной стратегии дообучения (SFT + RL) удалось достичь точности в 39.12%. Это означает более чем трехкратное улучшение способности модели к математическому рассуждению в узкой предметной области.

Метрика / Модель Значение Примечание
Базовая точность (Base) 12.37% Qwen2.5-3B без дообучения
Лучшая точность (Best) 39.12% После SFT + RL оптимизации
Улучшение >3x Относительный прирост точности
Бенчмарк WirelessMATHBench-XL Задачи уровня магистратуры

Значение для индустрии

Результаты SignalReasoner доказывают, что даже модели с небольшим количеством параметров (3 миллиарда) могут стать эффективными инструментами для инженерных задач, если их правильно подготовить. Использование доменно-специфичных цепочек рассуждений (CoT) в качестве начальной точки для RL-оптимизации оказалось критически важным шагом. Это открывает путь к созданию легких, специализированных AI-ассистентов для телекоммуникаций и обработки сигналов, которые не требуют огромных вычислительных ресурсов для инференса.

Источник: arXiv cs.AI ↗