Fireworks Research представила модель Ember-1, созданную методом пост-обучения (post-training) на базе открытой модели Moonshot AI Kimi K3. Ключевое отличие Ember-1 от базовой версии — способность генерировать более короткие цепочки рассуждений (reasoning traces), сокращая расход токенов примерно на 40% без потери точности ответов. Это не просто настройка параметра «усилия рассуждения» (reasoning effort) во время инференса, а фундаментальное изменение поведения модели через обучение.
Проблема, которую решает Ember-1, заключается в избыточности современных reasoning-моделей. По данным Fireworks, Kimi K3 может тратить более 90% сгенерированных токенов на внутренние размышления. В многошаговых агентных сценариях это приводит к квадратичному росту контекста и затрат, так как предыдущие длинные цепочки рассуждений переотправляются модели в каждом новом запросе.
01Методология и архитектура
Команда Fireworks не удаляла способность модели к рефлексии, а обучала её устранять冗余ные петли и избыточные шаги. Обучение проводилось на данных, охватывающих математику, программирование, follow instruction, поиск, использование инструментов и софт-инжиниринг. Использовалась обратная связь от задач и среды (task and environment feedback) для on-policy планирования.
Было проведено более 50 экспериментов по обучению и 200+ оценок. Все вычисления прошли на инфраструктуре Fireworks Serverless Training. Модель использует собственные данные Fireworks, данные клиентов не применялись.
02Бенчмарки: Ember-1 против Kimi K3
Сравнение проводилось с Kimi K3 в трех режимах усилия (Low, High, Max). Стоимость рассчитывалась на основе публичных тарифов Kimi K3. Ember-1 демонстрирует конкурентоспособные результаты, часто превосходя K3 Max по эффективности.
| Бенчмарк | K3 Low | K3 High | K3 Max | Ember-1 | Экономия vs K3 Max |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 89% | 76.4% | 77.6% | 80.9% | -51.9% / -23.1 USD |
| SWE-bench Verified | 500* | 80.4% | 86.0% | 93.2% | -15.5% / -68.1 USD |
| SWE-Interact | 75* | 6.7% | 13.3% | 21.3% | -32.5% / -60.8 USD |
| DeepSWE 1.1 | 113* | 55.8% | 62.8% | 66.4% | -23.7% / -126.9 USD |
| τ-2 Bench Airline | 50* | 64% | 64% | 66% | -5.9% / -0.3 USD |
*Примечание: В исходных данных для K3 Low указаны числа, не являющиеся процентами (вероятно, количество задач или специфичный метрик), тогда как для остальных режимов указаны проценты успешности. Ember-1 лидирует на Terminal Bench 2.1 и DeepSWE 1.1, немного уступая на SWE-bench Verified.
03Производственные тесты (A/B Testing)
Fireworks провела живые A/B тесты с двумя клиентами на реальных рабочих нагрузках по программированию. Результаты подтвердили теоретические выкладки:
- Снижение токенов: Выходные токены упали с 49.3K до 29.9K на задачу (экономия ~39%).
- Снижение рассуждений: Токены, затраченные на reasoning, сократились на 71.3%.
- Качество: Оценка задачи осталась практически неизменной: 0.753 для Ember-1 против 0.751 для K3.
- Шаги: Среднее количество шагов снизилось с 23.8 до 21.4.
Один из клиентов уже перевел Ember-1 в продакшн. На датасете Doximity Bedside Bench (500 клинических случаев) Ember-1 установила новую границу Парето по стоимости на задачу.
04Стоимость и доступность
Тарификация Ember-1 идентична Kimi K3 на платформе Fireworks. Экономия достигается исключительно за счет меньшего объема генерации.
- Input: $3.00 за 1M токенов.
- Cached Input: $0.30 за 1M токенов.
- Output: $15.00 за 1M токенов.
На основе данных A/B теста (29.9K выходных токенов на задачу) расчетная стоимость только за вывод составляет около $0.45 на задачу против $0.74 для K3.
05Кому подойдёт / что запустится
- Agentic-разработчики: Идеально для систем, где модель многократно обращается к себе же (multi-turn agents). Сокращение контекста критически важно для предотвращения переполнения окна и роста затрат.
- Команды с высоким объемом кодинга: Если ваш бюджет на LLM ограничен, а качество K3 Max слишком дорого, Ember-1 предлагает лучший баланс цены и качества.
- Локальные пользователи: Не подходит. Модель нельзя запустить на своих GPU (NVIDIA/AMD) из-за отсутствия весов. Требуется API-подписка.
- Сравнение с аналогами: Если вам нужна локальная оптимизация рассуждений, рассмотрите модели типа Qwen2.5-72B-Instruct с квантованием, но для Ember-1 вы платите за специализированную пост-обученную архитектуру.
Для интеграции используйте стандартный клиент Fireworks AI, указав модель fireworks/ember-1 (название модели может варьироваться в зависимости от актуального API-эндпоинта Research Preview).
Источник: MarkTechPost ↗
