Релиз модели28 сентября 2026 г., 11:18 МСК🤖 Auto

Fireworks AI: Ember-1 сокращает токены на 40% без потери качества

Fireworks AI представила Ember-1 — модель на базе Kimi K3, оптимизированную для эффективного рассуждения. Экономия достигается за счет сокращения «внутренних мыслей» модели, а не снижения ее интеллекта.

Баннер новости 8403

Проблема избыточного рассуждения

Компания Fireworks Research выявила критическую проблему в современных reasoning-моделях, таких как Moonshot AI’s Kimi K3: более 90% сгенерированных токенов тратится на внутренние рассуждения. В многошаговых агентных сценариях это приводит к квадратичному росту контекста и затрат, так как предыдущие длинные цепочки рассуждений переотправляются модели при каждом новом запросе.

Стандартное снижение уровня рассуждения (reasoning effort) при инференсе не помогло — качество падало слишком сильно. Решение Fireworks Research заключалось в пост-обучение (post-training) модели, чтобы она училась мыслить короче, сохраняя точность.

Результаты бенчмарков: Ember-1 против Kimi K3

Fireworks провела более 50 экспериментов по обучению и 200 оценок. Ember-1 демонстрирует конкурентоспособные или лучшие результаты по сравнению с Kimi K3 в режимах Low, High и Max. Ниже приведены ключевые метрики на основных тестах:

Бенчмарк K3 Low K3 High K3 Max Ember-1 Экономия (vs K3 Max)
Terminal Bench 2.1 89 76.4% 77.6% 80.9% -51.9% / -23.1 USD
SWE-bench Verified 500 80.4% 86.0% 92.2% -15.5% / -68.1 USD
SWE-Interact 75 6.7% 21.3% 20.0% -32.5% / -60.8 USD
DeepSWE 1.1 113 55.8% 66.4% 75.2% -23.7% / -126.9 USD
τ-2 Bench Airline 50 64% 64% 66% -5.9% / -0.3 USD

Ember-1 превосходит Kimi K3 Max в терминальных задачах (Terminal Bench 2.1 и DeepSWE 1.1), демонстрируя, что сокращение «мыслей» не вредит, а иногда даже улучшает результат в сложных сценариях.

Производственные тесты и экономика

В ходе A/B-тестирования с двумя клиентами в реальных условиях разработки ПО:

  • Количество токенов на задачу упало с 49.3K до 29.9K (экономия ~39-40%).
  • Токены рассуждения сократились на 71.3%.
  • Качество (task score) осталось неизменным: 0.753 у Ember-1 против 0.751 у K3.
  • Среднее количество шагов снизилось с 23.8 до 21.4.

Стоимость токенов в Fireworks API для Ember-1 такая же, как для K3 ($3.00 за вход, $15.00 за выход на 1M токенов). Однако за счет меньшего объема генерации стоимость вывода на задачу упала с ~$0.74 до ~$0.45.

Доступность и ограничения

Ember-1 доступна сейчас только через Fireworks Serverless API в статусе Research Preview. Весы модели, код обучения и алгоритмы не публикуются, поэтому самостоятельный хостинг (self-hosting) невозможен. Обучение проводилось на данных Fireworks без использования клиентских данных.

Бенчмарки

БенчмаркEmber-1K3 HighK3 LowK3 Max
Terminal Bench 2.180.9%76.4%89%77.6%
SWE-bench Verified93.2%80.4%500%86%
SWE-Interact21.3%6.7%75%13.3%
DeepSWE 1.166.4%55.8%113%62.8%
τ-2 Bench Airline66%64%50%64%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: MarkTechPost ↗