Проблема: «Frontier-премия» для простых задач
Корпоративное внедрение AI-агентов (таких как Claude Code) привело к взрывному росту расходов. По данным Forbes, бюджет Uber на AI был исчерпан за 4 месяца, а доля инженеров, использующих агентов, выросла с 33% до 80% за два месяца. Fireworks AI указывает, что главная проблема — не перерасход, а неэффективное распределение: рутинные задачи выполняются на самых дорогих моделях уровня frontier (SOTA).
Решение: Три компонента Fireworks Nexus
Платформа Nexus состоит из трех модулей, позволяющих внедрить контроль затрат «drop-in» способом:
- Enterprise Controls: Централизованный контроль бюджетов и политик. Данные обрабатываются на US-хостинге с нулевым хранением (zero data retention) в 20 дата-центрах.
- FireConnect: Плагин с лицензией Apache 2.0. Устанавливается одной командой, совместим с Claude Code, Codex и OpenCode. Работает через совместимые с Anthropic/OpenAI Serverless API.
- Intelligent Traffic Management: Кастомная модель-классификатор оценивает сложность запроса. Простые задачи отправляются на открытые модели (open-weight), сложные — на проприетарные ключи клиентов (которые не сохраняются на сервере Fireworks).
Результаты независимых тестов
Fireworks приводит данные от Faros AI и Arize, подтверждающие эффективность маршрутизации по сложности, а не по бренду модели.
| Источник / Метрика | Результат | Сравнение / Контекст |
|---|---|---|
| Faros AI (211 задач, 12 репозиториев) | GLM-5.2: $0.92 за задачу Opus 4.8: $1.76 за задачу |
Качество GLM-5.2 (0.568) выше, чем у Opus 4.8 (0.521). Кэширование не объясняет разницу (89.7% vs 99.7%). |
| Arize (2400 запусков, Terminal-Bench) | Маршрутизация: $0.525 за успешную задачу GPT-5.5 alone: $0.636 |
На легких задачах Kimi K2.6 (73% success) превосходит GPT-5.5 (69%). На сложных лидирует GPT-5.5 (51%). |
| Пилотные тесты Fireworks | Снижение стоимости merged PR на 33% | Смешанная цена токена составляет ~25% от стоимости закрытых лабораторий. |
Технические детали и ограничения
На данный момент маршрутизатор находится в стадии research preview. Базовая конфигурация маршрутизирует между Claude Opus 5 и GLM-5.2, требуя ключ Anthropic для прохода сложных запросов. Альтернативная «полностью открытая» конфигурация использует связку Kimi K3 и GLM-5.2.
Внедрение возможно тремя путями: через плагин FireConnect (наименьшее трение), через переменные окружения (ANTHROPIC_BASE_URL) или через прямой API-роутер. Архитектура позволяет строить «лестницу эскалации» (escalation ladder), где запросы поднимаются на более дорогие модели только при необходимости, что доказано как более эффективное решение, чем использование одной модели или случайный выбор.
Бенчмарки
| Бенчмарк | GPT-5.5 | Kimi K2.6 | Kimi K3 |
|---|---|---|---|
| Terminal-Bench | 51% | 73% | 32% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
