В отличие от традиционных LLM, которые тратят ресурсы на генерацию токенов, CLM-8B от Contrastive-LM решает задачу классификации и ранжирования. Это первая открытая модель класса Contrastive Language Model (CLM), предназначенная для агентов. Она принимает текущее состояние окружения и набор候选ных действий, возвращая вероятности выбора без генерации текста. Архитектура совместима с API TypeSafe (Jev), что позволяет использовать её как прямую замену в существующих пайплайнах.
01Архитектура и запуск
Модель построена на базе Qwen3-8B. В ней используются два замороженных энкодера (состояния и действия) и обучаемая проекционная голова (~20M параметров). Общая масса заголовка всего 75 МБ. Инференс выполняется через vLLM на Linux. Ключевая оптимизация — кэширование векторов состояний и действий (slab memory), что критично для агентов, где набор действий статичен, а состояние меняется.
Для запуска сервиса используйте следующую команду:
clm-serve --model Contrastive-LM/CLM-8B --tokenizer Qwen/Qwen3-8B --max-model-len 4096Клиентская часть доступна через Python-библиотеку, поддерживающую три типа запросов: Noul (проверка истинности), Choice (выбор из списка) и Score (оценка по шкале).
02Производительность: CLM-8B против Jev
Сравнение проводилось в zero-shot режиме. CLM-8B демонстрирует значительное преимущество в скорости, особенно в задачах с повторяющимися действиями. В игре T-Rex задержка снизилась в 9 раз, при этом качество выбора осталось на уровне проприетарного Jev.
| Задача | CLM-8B Latency | Jev Latency | CLM-8B Success | Jev Success |
|---|---|---|---|---|
| T-Rex game | 16.5 ms | 149.8 ms | 5/5 | 5/5 |
| Tool calling (BFCL v4) | 76.8 ms | 125.5 ms | 95.2% | 99.2% |
| WikiRacing | 79.8 ms | 225 ms | 26/30 | 30/30 |
| Super Mario | 33.5 ms | 132.6 ms | 5/5 | 5/5 |
Обратите внимание: на задачах Tool calling и WikiRacing CLM-8B немного уступает Jev по точности, но выигрывает в скорости. Фигура «9x» относится именно к T-Rex, где кэширование дает максимальный эффект.
03CLM как верификатор для Coding Agents
Наибольшую практическую ценность CLM-8B показывает в роли верификатора (Verifier) для генеративных моделей. В сценарии Best-of-N, где генератор (например, Opus 5 или Fable 5) создает несколько решений, CLM выбирает лучшее. Тесты проводились на H100 с использованием fine-tuned заголовков.
| Benchmark | Pass@1 (CLM fine-tuned) | Pass@1 (Jev) | CLM Latency | Jev Latency |
|---|---|---|---|---|
| DeepSWE | 73.7% | 81.6% | 79 ms | 449 ms |
| Terminal-Bench 2.1 | 84.0% | 87.6% | 32 ms | 131 ms |
Важный нюанс: Jev в режиме zero-shot показывает Pass@1 ниже, чем просто взятие одного случайного образца (71.1% и 83.1% соответственно). Fine-tuned CLM-8B превосходит этот базовый уровень и работает в 4-5 раз быстрее. Это делает её эффективным фильтром для отсечения плохих решений агентов.
04Обучение и данные
Модель обучалась в три этапа на данных, доступных для воспроизведения:
- Pre-training: ~60M пар вопросов-ответов из Nemotron DQA. Дает 52.1% точности.
- Mid-training: ~30M синтетических «hard negatives» от Gemini 2.5 Flash-Lite. Поднимает точность до 69.2%.
- Post-training: ~1M траекторий агентов (Agent Data Protocol, Endless-Terminals). Финальная донастройка.
Лицензия: Apache-2.0. Модель доступна на Hugging Face, код и данные для обучения открыты.
05Кому подойдёт / что запустится
- Agentic Frameworks: Идеально для LangGraph, AutoGen или CrewAI, где нужно быстро ранжировать инструменты или действия без генерации текста.
- Hardware: Требуется один GPU NVIDIA с поддержкой CUDA. RTX 4090 (24GB) достаточно для инференса. Для обучения потребуется больше VRAM (рекомендуется A100/H100 или несколько 4090).
- Use-case: Верификация кода, выбор инструментов (tool routing), оценка безопасности действий агента.
- Альтернативы: Если вам нужна генерация текста — смотрите Qwen3 или Llama. Если нужен только скоринг действий — CLM-8B сейчас лидер по соотношению цена/скорость среди открытых решений.
Источник: MarkTechPost ↗
