Новый стандарт для AI-агентов
Платформа T-Bench (Terminal-Bench) представила версию 4.0 — специализированный бенчмарк, предназначенный для оценки и эволюции фронтенд-моделей в задачах автономных агентов. В отличие от традиционных тестов, T-Bench 4.0 фокусируется на реальных сценариях работы агентов, измеряя не только точность, но и эффективность использования ресурсов.
Сравнение лидеров: Astra и Fable 5.1
Ключевое сравнение в последнем отчете коснулось двух ведущих моделей: Astra и Fable 5.1. Результаты демонстрируют, что Astra не только превосходит конкурента по ключевым метрикам, но и делает это с существенной экономией бюджета. Это критически важно для коммерческого внедрения AI-агентов, где маржинальность часто зависит от стоимости токенов.
| Модель | Агент | Решение задач (Resolution Rate) | Стоимость (Cost) | Токены (Tokens) |
|---|---|---|---|---|
| Astra | — | Лучший результат | ~50% от Fable 5.1 | — |
| Fable 5.1 | — | Ниже Astra | Базовый уровень | — |
Почему это важно?
Снижение стоимости при одновременном росте эффективности решения задач (Resolution Rate) указывает на зрелость архитектуры Astra. Для разработчиков и бизнеса это означает возможность масштабирования AI-агентов без пропорционального роста операционных расходов. T-Bench 4.0 становится новым ориентиром для оценки практической применимости моделей в сложных терминальных средах.
Доступ к бенчмарку
Полный доступ к задачам и запуску бенчмарка T-Bench 4.0 доступен на официальной платформе. Разработчики могут использовать эти данные для оптимизации своих решений и сравнения с текущими лидерами рынка.
Источник: Tbench ↗
