Релиз модели6 сентября 2026 г., 15:46 МСК🤖 Auto

Astra vs Fable 5.1: новый лидер T-Bench 4.0 с ценовым преимуществом

В обновленном бенчмарке T-Bench 4.0 модель Astra показала лучшие результаты по сравнению с Fable 5.1, при этом стоимость выполнения задач оказалась почти вдвое ниже.

Баннер новости 6884

Новый стандарт для AI-агентов

Платформа T-Bench (Terminal-Bench) представила версию 4.0 — специализированный бенчмарк, предназначенный для оценки и эволюции фронтенд-моделей в задачах автономных агентов. В отличие от традиционных тестов, T-Bench 4.0 фокусируется на реальных сценариях работы агентов, измеряя не только точность, но и эффективность использования ресурсов.

Сравнение лидеров: Astra и Fable 5.1

Ключевое сравнение в последнем отчете коснулось двух ведущих моделей: Astra и Fable 5.1. Результаты демонстрируют, что Astra не только превосходит конкурента по ключевым метрикам, но и делает это с существенной экономией бюджета. Это критически важно для коммерческого внедрения AI-агентов, где маржинальность часто зависит от стоимости токенов.

Модель Агент Решение задач (Resolution Rate) Стоимость (Cost) Токены (Tokens)
Astra Лучший результат ~50% от Fable 5.1
Fable 5.1 Ниже Astra Базовый уровень

Почему это важно?

Снижение стоимости при одновременном росте эффективности решения задач (Resolution Rate) указывает на зрелость архитектуры Astra. Для разработчиков и бизнеса это означает возможность масштабирования AI-агентов без пропорционального роста операционных расходов. T-Bench 4.0 становится новым ориентиром для оценки практической применимости моделей в сложных терминальных средах.

Доступ к бенчмарку

Полный доступ к задачам и запуску бенчмарка T-Bench 4.0 доступен на официальной платформе. Разработчики могут использовать эти данные для оптимизации своих решений и сравнения с текущими лидерами рынка.

Источник: Tbench ↗