Суть проблемы: переплата за рутину
Cursor сообщает, что около 60% разработчиков используют одну и ту же модель-драйвер для всех задач, включая простые. Это приводит к тому, что рутинные операции оплачиваются по цене «фронтенд»-моделей. Cursor Router решает эту проблему, анализируя каждый запрос до его отправки модели и перенаправляя его на наиболее подходящий вариант.
Как работает классификатор
Система обучена на базе из 600 000+ живых запросов и оптимизирована по метрике удовлетворенности пользователя (AFC). Роутер учитывает четыре ключевых параметра:
- Текст запроса (query)
- Контекст (context)
- Сложность задачи (task complexity)
- Домен (domain)
Важная техническая деталь: роутер является cache-aware (учитывает кэш). В отличие от многих аналогов, Cursor учитывает стоимость промахов кэша (cache misses) при переключении моделей в рамках одной сессии, что делает расчет экономии реалистичным.
Три режима работы и экономия
Cursor предлагает три режима в Auto, позволяющие выбрать баланс между стоимостью и интеллектом. Ниже приведены данные по стоимости за коммит (cost per commit) на основе ранних тестов Enterprise-аккаунтов:
| Режим / Модель | Стоимость за коммит | Экономия vs Opus 4.8 | Качество (User Satisfaction) |
|---|---|---|---|
| Auto Balance | $4.63 | −36% | Выше, чем у Opus 4.8 |
| Auto Intelligence | $6.76 | −8% | Сопоставимо с Fable 5, на 15% выше Opus 4.8 |
| Opus 4.8 | $7.34 | — | Базовый уровень |
| Fable 5 | $12.69 | +73% | Высший класс (дороже) |
В онлайн A/B тестах на миллионах запросов Cursor зафиксировал экономию до 60% по сравнению с использованием одной модели-драйвера. Для ранних пользователей Enterprise-планов средняя экономия составила 30–50%.
Почему это важно для индустрии
Cursor отказался от традиционных офлайн-бенчмарков в пользу онлайн-тестов, так как они не учитывают контекст диалога и стоимость переключения моделей. Метрики качества базируются на двух реальных показателях:
- User Satisfaction: пользователь переходит к следующей фиче (позитив) или исправляет код агента (негатив).
- Keep Rate: доля кода, написанного AI, которая остается в кодовой базе в долгосрочной перспективе.
Система также спроектирована с учетом высокой текучести моделей (model churn), позволяя обновлять роутер по мере выхода новых версий AI-ассистентов.
Источник: MarkTechPost ↗
