Что такое Clef и почему это не чат-бот
Cloudflare выпустила Clef — модель принятия решений (decision model) объемом 27 миллиардов параметров. В отличие от традиционных LLM, Clef не пишет эссе и не ведет диалоги. Ее задача — принять единственно верное решение на основе состояния системы (текст, JSON, изображения или видео) и заданной схемы вопросов.
Модель работает в один проход (single forward pass): она считывает входные данные и возвращает вероятность для каждого допустимого варианта ответа. Здесь нет «свободного» генеративного текста, что исключает галлюцинации и необходимость сложной постобработки (parsing) результата. Clef пост-обучена на базе Qwen/Qwen3.8-27B и использует совместную схему (joint schema head) для маршрутизации доказательств к конкретным вопросам.
Ключевые метрики и бенчмарки
В сравнении с другими моделями (Jev, Kev 9B, DiffusionGemma) Clef демонстрирует выдающиеся результаты в задачах классификации, маршрутизации и обработки документов. Ниже приведены ключевые показатели из внутреннего набора тестов Decision Index 0.2.1:
| Бенчмарк | Метрика | Clef | Clef-flash | Jev | Примечание |
|---|---|---|---|---|---|
| BFCL | Case exact accuracy | 98.5 | 98.8 | 95.8 | Высокая точность в сложных сценариях |
| ToolRet | nDCG@10 | 69.2 | 66.4 | 65.3 | Рейтинг инструментов |
| API-Bank | Accuracy | 91.9 | 93.1 | 88.2 | Понимание API-вызовов |
| Home appliance simulator | Case exact accuracy | 83.0 | 97.7 | 52.3 | Управление устройствами (Clef-flash лидирует) |
| ForecastBench | Brier score (ниже = лучше) | 13.9 | 10.6 | 17.4 | Прогнозирование |
| Median latency | ms (ниже = быстрее) | 209.3 | 38.8 | 524.1 | Скорость на H200 |
Мультимодальность и совместимость
Clef принимает на вход не только текст и JSON, но и изображения, и видео. Это критически важно для задач вроде обработки счетов-фактур (OCR + логика) или анализа инцидентов безопасности. Модель совместима с API Jev и SystemOne, что позволяет легко интегрировать ее в существующие конвейеры агентов.
Существует две версии:
- Clef (27B) — максимальная точность, задержка ~209 мс (p95 ~238 мс).
- Clef-flash — облегченная версия, задержка всего ~39 мс, идеальна для высокочастотных транзакций.
Практическое применение: бизнес-воркфлоу
В тестах на реальных бизнес-сценариях (Typesafe Evals) Clef показала себя как надежный «мозг» для автоматизации:
- Обработка счетов: 86.2% точности в определении основного действия (Exact actions: 64.7%).
- Клиентская поддержка: 76.3% точности в выборе команды (billing/technical).
- Инциденты безопасности: 62.9% точности в классификации угроз.
Модель лицензирована под Apache-2.0, что делает ее открытой для коммерческого использования. Архитектура позволяет использовать стандартные safetensors и работает с torch 2.11+ на GPU NVIDIA H200.
Бенчмарки
| Бенчмарк | Clef | Clef-flash | Jev |
|---|---|---|---|
| MMLU | 90.3% | 91.8% | 91.7% |
| GPQA Diamond | 48% | 51% | 78.3% |
| ARC-Easy | 99% | 99.5% | 99.3% |
| ARC-Challenge | 97.7% | 98.3% | 97.8% |
| MMLU-Pro | 65.9% | 65.3% | 82.7% |
| BBH | 73.7% | 68.9% | 92.9% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: Huggingface ↗
