Главная/Блог/Гайд/Fireworks Ember-1: Оптимизация Kimi K3…
Гайд4 мин чтения · 28 сентября 2026 г.

Fireworks Ember-1: Оптимизация Kimi K3 для снижения затрат на токены

Fireworks AI выпустила Ember-1 — модель на базе Kimi K3, использующая на 40% меньше токенов при сохранении качества. Разбор бенчмарков, цен и ограничений для деплоя.

Fireworks Ember-1: Оптимизация Kimi K3 для снижения затрат на токены

Fireworks Research представила модель Ember-1, созданную методом пост-обучения (post-training) на базе открытой модели Moonshot AI Kimi K3. Ключевое отличие Ember-1 от базовой версии — способность генерировать более короткие цепочки рассуждений (reasoning traces), сокращая расход токенов примерно на 40% без потери точности ответов. Это не просто настройка параметра «усилия рассуждения» (reasoning effort) во время инференса, а фундаментальное изменение поведения модели через обучение.

Проблема, которую решает Ember-1, заключается в избыточности современных reasoning-моделей. По данным Fireworks, Kimi K3 может тратить более 90% сгенерированных токенов на внутренние размышления. В многошаговых агентных сценариях это приводит к квадратичному росту контекста и затрат, так как предыдущие длинные цепочки рассуждений переотправляются модели в каждом новом запросе.

💡
Важно для практиков. Ember-1 доступна исключительно через серверное API Fireworks в статусе Research Preview. Веса модели, код обучения и алгоритмы не опубликованы, поэтому самостоятельный хостинг (self-hosting) на локальном железе или в облаке на данный момент невозможен.

01Методология и архитектура

Команда Fireworks не удаляла способность модели к рефлексии, а обучала её устранять冗余ные петли и избыточные шаги. Обучение проводилось на данных, охватывающих математику, программирование, follow instruction, поиск, использование инструментов и софт-инжиниринг. Использовалась обратная связь от задач и среды (task and environment feedback) для on-policy планирования.

Было проведено более 50 экспериментов по обучению и 200+ оценок. Все вычисления прошли на инфраструктуре Fireworks Serverless Training. Модель использует собственные данные Fireworks, данные клиентов не применялись.

02Бенчмарки: Ember-1 против Kimi K3

Сравнение проводилось с Kimi K3 в трех режимах усилия (Low, High, Max). Стоимость рассчитывалась на основе публичных тарифов Kimi K3. Ember-1 демонстрирует конкурентоспособные результаты, часто превосходя K3 Max по эффективности.

Бенчмарк K3 Low K3 High K3 Max Ember-1 Экономия vs K3 Max
Terminal Bench 2.1 89% 76.4% 77.6% 80.9% -51.9% / -23.1 USD
SWE-bench Verified 500* 80.4% 86.0% 93.2% -15.5% / -68.1 USD
SWE-Interact 75* 6.7% 13.3% 21.3% -32.5% / -60.8 USD
DeepSWE 1.1 113* 55.8% 62.8% 66.4% -23.7% / -126.9 USD
τ-2 Bench Airline 50* 64% 64% 66% -5.9% / -0.3 USD

*Примечание: В исходных данных для K3 Low указаны числа, не являющиеся процентами (вероятно, количество задач или специфичный метрик), тогда как для остальных режимов указаны проценты успешности. Ember-1 лидирует на Terminal Bench 2.1 и DeepSWE 1.1, немного уступая на SWE-bench Verified.

⚠️
Внимание к деталям. На SWE-bench Verified Ember-1 показал 92.2% (согласно сводке в тексте), что ниже K3 Max (93.2%), но при этом стоимость инференса снизилась на 15.5%. Это классический компромисс между качеством и стоимостью.

03Производственные тесты (A/B Testing)

Fireworks провела живые A/B тесты с двумя клиентами на реальных рабочих нагрузках по программированию. Результаты подтвердили теоретические выкладки:

  • Снижение токенов: Выходные токены упали с 49.3K до 29.9K на задачу (экономия ~39%).
  • Снижение рассуждений: Токены, затраченные на reasoning, сократились на 71.3%.
  • Качество: Оценка задачи осталась практически неизменной: 0.753 для Ember-1 против 0.751 для K3.
  • Шаги: Среднее количество шагов снизилось с 23.8 до 21.4.

Один из клиентов уже перевел Ember-1 в продакшн. На датасете Doximity Bedside Bench (500 клинических случаев) Ember-1 установила новую границу Парето по стоимости на задачу.

04Стоимость и доступность

Тарификация Ember-1 идентична Kimi K3 на платформе Fireworks. Экономия достигается исключительно за счет меньшего объема генерации.

  • Input: $3.00 за 1M токенов.
  • Cached Input: $0.30 за 1M токенов.
  • Output: $15.00 за 1M токенов.

На основе данных A/B теста (29.9K выходных токенов на задачу) расчетная стоимость только за вывод составляет около $0.45 на задачу против $0.74 для K3.

📌
Доступ из РФ. Прямой доступ к API Fireworks из России может быть ограничен из-за санкций и требований к верификации платежных средств. Рекомендуется использовать посредников или корпоративные аккаунты с международной регистрацией.

05Кому подойдёт / что запустится

  • Agentic-разработчики: Идеально для систем, где модель многократно обращается к себе же (multi-turn agents). Сокращение контекста критически важно для предотвращения переполнения окна и роста затрат.
  • Команды с высоким объемом кодинга: Если ваш бюджет на LLM ограничен, а качество K3 Max слишком дорого, Ember-1 предлагает лучший баланс цены и качества.
  • Локальные пользователи: Не подходит. Модель нельзя запустить на своих GPU (NVIDIA/AMD) из-за отсутствия весов. Требуется API-подписка.
  • Сравнение с аналогами: Если вам нужна локальная оптимизация рассуждений, рассмотрите модели типа Qwen2.5-72B-Instruct с квантованием, но для Ember-1 вы платите за специализированную пост-обученную архитектуру.

Для интеграции используйте стандартный клиент Fireworks AI, указав модель fireworks/ember-1 (название модели может варьироваться в зависимости от актуального API-эндпоинта Research Preview).

Источник: MarkTechPost ↗