Исследования3 июля 2026 г., 13:19 МСК🤖 Auto

RLVR против next-token: Qwen3.5-4B идеально управляет Jira/Confluence

Исследователи доказали, что обучение с подкреплением (RLVR) позволяет малым моделям (4B) безошибочно выполнять сложные API-запросы в Atlassian, устраняя галлюцинации.

Баннер новости 2841

Проблема: Разрыв между предсказанием токенов и реальными действиями

Большие языковые модели (LLM) традиционно обучаются предсказывать следующий токен, а не взаимодействовать с конкретными API. В корпоративных SaaS-средах, таких как Atlassian, это приводит к «тихим сбоям»: модель пропускает обязательные поля, выдумывает несуществующие инструменты или останавливается после первого же чтения. Авторы исследования (Karthikeya Aditya Vissa и соавт.) предлагают закрыть этот разрыв с помощью Reinforcement Learning with Verifiable Rewards (RLVR) — обучения с подкреплением, где награда вычисляется строго по факту успешного вызова инструмента.

Методология: Синтетические среды без живых API

Для проверки гипотезы команда создала пять синтетических сред, эмулирующих Jira REST v3 и Confluence v2 APIs с полной точностью схемы. Ключевая особенность подхода — отсутствие живых API, обученных судей или человеческой разметки. Награда вычисляется исключительно на основе трассы вызовов инструментов (tool-call trace), что делает процесс масштабируемым и объективным.

Результаты: Прорыв в точности выполнения

Исследователи протестировали модели Qwen3-1.7B и Qwen3.5-4B на чекерах, используемых для обучения GRPO. После применения RLVR обученная политика показала значительный рост средней награды по четырем сценариям с неденеративными наградами. Базовая модель 4B показывала результаты в диапазоне 0.35–0.92, тогда как RLVR-модель достигла 0.95–1.00.

Сценарий Базовый результат (Qwen3.5-4B) Результат после RLVR Комментарий
Создание страницы Confluence 0.35 1.00 Максимальный прирост: устранение пропусков полей
Создание задачи Jira 0.60 0.98 Высокая точность вложенных аргументов
Обновление задачи Jira 0.75 0.99 Стабильное выполнение
Получение списка задач 0.92 1.00 Базовая модель уже работала хорошо
Переход статуса задачи 1.00 1.00 Награда насыщена, улучшения нет

Ограничения и перспективы

Авторы отмечают два критических ограничения. Во-первых, ручное создание верифицируемых наград не масштабируется на сотни эндпоинтов. Во-вторых, один из сценариев (переход статуса) имеет форму награды, которая уже была максимизирована базовой моделью. Тем не менее, работа позиционируется как важный шаг к созданию оптимизированных под конкретные задачи малых моделей для нишевых корпоративных API.

Источник: arXiv cs.AI ↗