Лаборатория Fireworks Research анонсировала выпуск модели Ember-1, позиционируя её как прорыв в области эффективного использования ресурсов больших языковых моделей (LLM). Ember-1 создана на базе Kimi K3, но обучена устранять избыточные рассуждения, что позволяет сократить количество генерируемых токенов на 35–50% без ущерба для качества ответов. Модель доступна для использования через платформу Fireworks Training Platform.
Проблема избыточного «мышления»
Ключевая проблема современных reasoning-моделей, таких как Kimi K3, заключается в том, что до 90% сгенерированных токенов уходит на внутренние цепочки рассуждений, а не на финальный ответ. В многошаговых агентных сценариях это приводит к квадратичному росту контекста и стоимости, так как предыдущие рассуждения переосмысливаются на каждом шаге. Ember-1 решает эту проблему, обучаясь отличать полезную рефлексию от непродуктивных циклов, сохраняя способность к самовосстановлению, но сокращая длину «мыслей».
Результаты на бенчмарках
Модель протестирована на ряде индустриальных бенчмарков, включая SWE-bench и Terminal Bench. Ember-1 демонстрирует конкурентоспособность с Kimi K3 в режиме максимальных усилий (max), но при значительно меньших затратах. Ниже приведено сравнение эффективности на ключевых задачах:
| Бенчмарк | Качество (Pass Rate) | Экономия токенов vs K3 Max | Экономия ($) |
|---|---|---|---|
| SWE-bench Verified | 92.2% (Ember-1) vs 93.2% (K3 Max) | -15.5% | -68.1 USD |
| DeepSWE 1.1 | 75.2% (Ember-1) vs 66.4% (K3 Max)* | -23.7% | -126.9 USD |
| Terminal Bench 2.1 | 80.9% (Ember-1) vs 77.6% (K3 Max)* | -51.9% | -23.1 USD |
Примечание: В таблице указаны относительные показатели эффективности. Ember-1 строго доминирует над K3 в режиме низких усилий (Low) и сопоставима с K3 Max, но дешевле.
Валидация в продакшене
Fireworks провела A/B тесты с двумя клиентами в реальных условиях разработки. Результаты показали снижение потребления токенов на 39% при сохранении или улучшении метрик завершения задач. Один из клиентов уже перевел Ember-1 в продуктивную среду для замены базовой модели. Дополнительно модель показала себя на медицинском бенчмарке Bedside Bench, установив новую Парето-границу по соотношению «стоимость/задача» среди открытых и закрытых моделей, включая GPT-5.6 Sol и Claude Opus 5.
Технические детали
Обучение проводилось на платформе Fireworks Serverless Training без использования клиентских данных. Команда провела более 50 экспериментов и 200 оценок, разработав новые алгоритмы тренировки, направленные на сокращение длины рассуждений. Ember-1 является первой моделью в серии специализированных моделей от Fireworks Research, ориентированных на конкретные потребности разработчиков.
Бенчмарки
| Бенчмарк | Ember-1 | K3 High | K3 Low | K3 max |
|---|---|---|---|---|
| Terminal Bench 2.1 | 80.9% | 76.4% | 89% | 77.6% |
| SWE-bench Verified | 92.2% | 86% | 80.4% | 93.2% |
| SWE-Interact | 20% | 13.3% | 6.7% | 21.3% |
| DeepSWE 1.1 | 75.2% | 62.8% | 55.8% | 66.4% |
| τ-2 Bench Airline | 66% | 64% | 64% | 64% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: Fireworks ↗
