Релиз модели28 сентября 2026 г., 15:47 МСК🤖 Auto

Fireworks представила Ember-1: 40% экономии токенов без потери качества

Fireworks Research выпустила специализированную модель Ember-1 на базе Kimi K3, которая сокращает расход токенов на 40% за счет оптимизации процесса рассуждения, сохраняя при этом уровень точности.

Баннер новости 8425

Лаборатория Fireworks Research анонсировала выпуск модели Ember-1, позиционируя её как прорыв в области эффективного использования ресурсов больших языковых моделей (LLM). Ember-1 создана на базе Kimi K3, но обучена устранять избыточные рассуждения, что позволяет сократить количество генерируемых токенов на 35–50% без ущерба для качества ответов. Модель доступна для использования через платформу Fireworks Training Platform.

Проблема избыточного «мышления»

Ключевая проблема современных reasoning-моделей, таких как Kimi K3, заключается в том, что до 90% сгенерированных токенов уходит на внутренние цепочки рассуждений, а не на финальный ответ. В многошаговых агентных сценариях это приводит к квадратичному росту контекста и стоимости, так как предыдущие рассуждения переосмысливаются на каждом шаге. Ember-1 решает эту проблему, обучаясь отличать полезную рефлексию от непродуктивных циклов, сохраняя способность к самовосстановлению, но сокращая длину «мыслей».

Результаты на бенчмарках

Модель протестирована на ряде индустриальных бенчмарков, включая SWE-bench и Terminal Bench. Ember-1 демонстрирует конкурентоспособность с Kimi K3 в режиме максимальных усилий (max), но при значительно меньших затратах. Ниже приведено сравнение эффективности на ключевых задачах:

Бенчмарк Качество (Pass Rate) Экономия токенов vs K3 Max Экономия ($)
SWE-bench Verified 92.2% (Ember-1) vs 93.2% (K3 Max) -15.5% -68.1 USD
DeepSWE 1.1 75.2% (Ember-1) vs 66.4% (K3 Max)* -23.7% -126.9 USD
Terminal Bench 2.1 80.9% (Ember-1) vs 77.6% (K3 Max)* -51.9% -23.1 USD

Примечание: В таблице указаны относительные показатели эффективности. Ember-1 строго доминирует над K3 в режиме низких усилий (Low) и сопоставима с K3 Max, но дешевле.

Валидация в продакшене

Fireworks провела A/B тесты с двумя клиентами в реальных условиях разработки. Результаты показали снижение потребления токенов на 39% при сохранении или улучшении метрик завершения задач. Один из клиентов уже перевел Ember-1 в продуктивную среду для замены базовой модели. Дополнительно модель показала себя на медицинском бенчмарке Bedside Bench, установив новую Парето-границу по соотношению «стоимость/задача» среди открытых и закрытых моделей, включая GPT-5.6 Sol и Claude Opus 5.

Технические детали

Обучение проводилось на платформе Fireworks Serverless Training без использования клиентских данных. Команда провела более 50 экспериментов и 200 оценок, разработав новые алгоритмы тренировки, направленные на сокращение длины рассуждений. Ember-1 является первой моделью в серии специализированных моделей от Fireworks Research, ориентированных на конкретные потребности разработчиков.

Бенчмарки

БенчмаркEmber-1K3 HighK3 LowK3 max
Terminal Bench 2.180.9%76.4%89%77.6%
SWE-bench Verified92.2%86%80.4%93.2%
SWE-Interact20%13.3%6.7%21.3%
DeepSWE 1.175.2%62.8%55.8%66.4%
τ-2 Bench Airline66%64%64%64%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: Fireworks ↗