Релиз модели29 июля 2026 г., 02:16 МСК🤖 Auto

Fireworks Nexus: Маршрутизация AI-запросов для экономии до 5x

Fireworks AI представили Nexus — слой маршрутизации, который автоматически перенаправляет рутинный код на открытые модели, снижая затраты на 33–80% без потери качества.

Баннер новости 4586

Проблема: «Frontier-премия» для простых задач

Корпоративное внедрение AI-агентов (таких как Claude Code) привело к взрывному росту расходов. По данным Forbes, бюджет Uber на AI был исчерпан за 4 месяца, а доля инженеров, использующих агентов, выросла с 33% до 80% за два месяца. Fireworks AI указывает, что главная проблема — не перерасход, а неэффективное распределение: рутинные задачи выполняются на самых дорогих моделях уровня frontier (SOTA).

Решение: Три компонента Fireworks Nexus

Платформа Nexus состоит из трех модулей, позволяющих внедрить контроль затрат «drop-in» способом:

  • Enterprise Controls: Централизованный контроль бюджетов и политик. Данные обрабатываются на US-хостинге с нулевым хранением (zero data retention) в 20 дата-центрах.
  • FireConnect: Плагин с лицензией Apache 2.0. Устанавливается одной командой, совместим с Claude Code, Codex и OpenCode. Работает через совместимые с Anthropic/OpenAI Serverless API.
  • Intelligent Traffic Management: Кастомная модель-классификатор оценивает сложность запроса. Простые задачи отправляются на открытые модели (open-weight), сложные — на проприетарные ключи клиентов (которые не сохраняются на сервере Fireworks).

Результаты независимых тестов

Fireworks приводит данные от Faros AI и Arize, подтверждающие эффективность маршрутизации по сложности, а не по бренду модели.

Источник / Метрика Результат Сравнение / Контекст
Faros AI (211 задач, 12 репозиториев) GLM-5.2: $0.92 за задачу
Opus 4.8: $1.76 за задачу
Качество GLM-5.2 (0.568) выше, чем у Opus 4.8 (0.521). Кэширование не объясняет разницу (89.7% vs 99.7%).
Arize (2400 запусков, Terminal-Bench) Маршрутизация: $0.525 за успешную задачу
GPT-5.5 alone: $0.636
На легких задачах Kimi K2.6 (73% success) превосходит GPT-5.5 (69%). На сложных лидирует GPT-5.5 (51%).
Пилотные тесты Fireworks Снижение стоимости merged PR на 33% Смешанная цена токена составляет ~25% от стоимости закрытых лабораторий.

Технические детали и ограничения

На данный момент маршрутизатор находится в стадии research preview. Базовая конфигурация маршрутизирует между Claude Opus 5 и GLM-5.2, требуя ключ Anthropic для прохода сложных запросов. Альтернативная «полностью открытая» конфигурация использует связку Kimi K3 и GLM-5.2.

Внедрение возможно тремя путями: через плагин FireConnect (наименьшее трение), через переменные окружения (ANTHROPIC_BASE_URL) или через прямой API-роутер. Архитектура позволяет строить «лестницу эскалации» (escalation ladder), где запросы поднимаются на более дорогие модели только при необходимости, что доказано как более эффективное решение, чем использование одной модели или случайный выбор.

Бенчмарки

БенчмаркGPT-5.5Kimi K2.6Kimi K3
Terminal-Bench51%73%32%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: MarkTechPost ↗