Проблема избыточного рассуждения
Компания Fireworks Research выявила критическую проблему в современных reasoning-моделях, таких как Moonshot AI’s Kimi K3: более 90% сгенерированных токенов тратится на внутренние рассуждения. В многошаговых агентных сценариях это приводит к квадратичному росту контекста и затрат, так как предыдущие длинные цепочки рассуждений переотправляются модели при каждом новом запросе.
Стандартное снижение уровня рассуждения (reasoning effort) при инференсе не помогло — качество падало слишком сильно. Решение Fireworks Research заключалось в пост-обучение (post-training) модели, чтобы она училась мыслить короче, сохраняя точность.
Результаты бенчмарков: Ember-1 против Kimi K3
Fireworks провела более 50 экспериментов по обучению и 200 оценок. Ember-1 демонстрирует конкурентоспособные или лучшие результаты по сравнению с Kimi K3 в режимах Low, High и Max. Ниже приведены ключевые метрики на основных тестах:
| Бенчмарк | K3 Low | K3 High | K3 Max | Ember-1 | Экономия (vs K3 Max) |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 89 | 76.4% | 77.6% | 80.9% | -51.9% / -23.1 USD |
| SWE-bench Verified | 500 | 80.4% | 86.0% | 92.2% | -15.5% / -68.1 USD |
| SWE-Interact | 75 | 6.7% | 21.3% | 20.0% | -32.5% / -60.8 USD |
| DeepSWE 1.1 | 113 | 55.8% | 66.4% | 75.2% | -23.7% / -126.9 USD |
| τ-2 Bench Airline | 50 | 64% | 64% | 66% | -5.9% / -0.3 USD |
Ember-1 превосходит Kimi K3 Max в терминальных задачах (Terminal Bench 2.1 и DeepSWE 1.1), демонстрируя, что сокращение «мыслей» не вредит, а иногда даже улучшает результат в сложных сценариях.
Производственные тесты и экономика
В ходе A/B-тестирования с двумя клиентами в реальных условиях разработки ПО:
- Количество токенов на задачу упало с 49.3K до 29.9K (экономия ~39-40%).
- Токены рассуждения сократились на 71.3%.
- Качество (task score) осталось неизменным: 0.753 у Ember-1 против 0.751 у K3.
- Среднее количество шагов снизилось с 23.8 до 21.4.
Стоимость токенов в Fireworks API для Ember-1 такая же, как для K3 ($3.00 за вход, $15.00 за выход на 1M токенов). Однако за счет меньшего объема генерации стоимость вывода на задачу упала с ~$0.74 до ~$0.45.
Доступность и ограничения
Ember-1 доступна сейчас только через Fireworks Serverless API в статусе Research Preview. Весы модели, код обучения и алгоритмы не публикуются, поэтому самостоятельный хостинг (self-hosting) невозможен. Обучение проводилось на данных Fireworks без использования клиентских данных.
Бенчмарки
| Бенчмарк | Ember-1 | K3 High | K3 Low | K3 Max |
|---|---|---|---|---|
| Terminal Bench 2.1 | 80.9% | 76.4% | 89% | 77.6% |
| SWE-bench Verified | 93.2% | 80.4% | 500% | 86% |
| SWE-Interact | 21.3% | 6.7% | 75% | 13.3% |
| DeepSWE 1.1 | 66.4% | 55.8% | 113% | 62.8% |
| τ-2 Bench Airline | 66% | 64% | 50% | 64% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
