Проблема: Разрыв между предсказанием токенов и реальными действиями
Большие языковые модели (LLM) традиционно обучаются предсказывать следующий токен, а не взаимодействовать с конкретными API. В корпоративных SaaS-средах, таких как Atlassian, это приводит к «тихим сбоям»: модель пропускает обязательные поля, выдумывает несуществующие инструменты или останавливается после первого же чтения. Авторы исследования (Karthikeya Aditya Vissa и соавт.) предлагают закрыть этот разрыв с помощью Reinforcement Learning with Verifiable Rewards (RLVR) — обучения с подкреплением, где награда вычисляется строго по факту успешного вызова инструмента.
Методология: Синтетические среды без живых API
Для проверки гипотезы команда создала пять синтетических сред, эмулирующих Jira REST v3 и Confluence v2 APIs с полной точностью схемы. Ключевая особенность подхода — отсутствие живых API, обученных судей или человеческой разметки. Награда вычисляется исключительно на основе трассы вызовов инструментов (tool-call trace), что делает процесс масштабируемым и объективным.
Результаты: Прорыв в точности выполнения
Исследователи протестировали модели Qwen3-1.7B и Qwen3.5-4B на чекерах, используемых для обучения GRPO. После применения RLVR обученная политика показала значительный рост средней награды по четырем сценариям с неденеративными наградами. Базовая модель 4B показывала результаты в диапазоне 0.35–0.92, тогда как RLVR-модель достигла 0.95–1.00.
| Сценарий | Базовый результат (Qwen3.5-4B) | Результат после RLVR | Комментарий |
|---|---|---|---|
| Создание страницы Confluence | 0.35 | 1.00 | Максимальный прирост: устранение пропусков полей |
| Создание задачи Jira | 0.60 | 0.98 | Высокая точность вложенных аргументов |
| Обновление задачи Jira | 0.75 | 0.99 | Стабильное выполнение |
| Получение списка задач | 0.92 | 1.00 | Базовая модель уже работала хорошо |
| Переход статуса задачи | 1.00 | 1.00 | Награда насыщена, улучшения нет |
Ограничения и перспективы
Авторы отмечают два критических ограничения. Во-первых, ручное создание верифицируемых наград не масштабируется на сотни эндпоинтов. Во-вторых, один из сценариев (переход статуса) имеет форму награды, которая уже была максимизирована базовой моделью. Тем не менее, работа позиционируется как важный шаг к созданию оптимизированных под конкретные задачи малых моделей для нишевых корпоративных API.
Источник: arXiv cs.AI ↗
