Главная/Блог/Обзор/CLM-8B: Open System One модель для…
Обзор3 мин чтения · 24 сентября 2026 г.

CLM-8B: Open System One модель для агентов (9x быстрее Jev)

Contrastive-LM выпустила CLM-8B — первую открытую System One модель. Она не генерирует текст, а ранжирует действия агента с задержкой до 9x ниже, чем проприетарный Jev, на одном GPU.

CLM-8B: Open System One модель для агентов (9x быстрее Jev)

В отличие от традиционных LLM, которые тратят ресурсы на генерацию токенов, CLM-8B от Contrastive-LM решает задачу классификации и ранжирования. Это первая открытая модель класса Contrastive Language Model (CLM), предназначенная для агентов. Она принимает текущее состояние окружения и набор候选ных действий, возвращая вероятности выбора без генерации текста. Архитектура совместима с API TypeSafe (Jev), что позволяет использовать её как прямую замену в существующих пайплайнах.

01Архитектура и запуск

Модель построена на базе Qwen3-8B. В ней используются два замороженных энкодера (состояния и действия) и обучаемая проекционная голова (~20M параметров). Общая масса заголовка всего 75 МБ. Инференс выполняется через vLLM на Linux. Ключевая оптимизация — кэширование векторов состояний и действий (slab memory), что критично для агентов, где набор действий статичен, а состояние меняется.

Для запуска сервиса используйте следующую команду:

terminalbash
clm-serve --model Contrastive-LM/CLM-8B --tokenizer Qwen/Qwen3-8B --max-model-len 4096

Клиентская часть доступна через Python-библиотеку, поддерживающую три типа запросов: Noul (проверка истинности), Choice (выбор из списка) и Score (оценка по шкале).

💡
Оптимизация VRAM. Благодаря кэшированию, при повторном использовании состояний задержка падает с 1.7 мс до 0.6 мс на RTX 4090. Модель укладывается в память одного GPU (24 ГБ+), что делает её доступной для локального деплоя.

02Производительность: CLM-8B против Jev

Сравнение проводилось в zero-shot режиме. CLM-8B демонстрирует значительное преимущество в скорости, особенно в задачах с повторяющимися действиями. В игре T-Rex задержка снизилась в 9 раз, при этом качество выбора осталось на уровне проприетарного Jev.

Задача CLM-8B Latency Jev Latency CLM-8B Success Jev Success
T-Rex game 16.5 ms 149.8 ms 5/5 5/5
Tool calling (BFCL v4) 76.8 ms 125.5 ms 95.2% 99.2%
WikiRacing 79.8 ms 225 ms 26/30 30/30
Super Mario 33.5 ms 132.6 ms 5/5 5/5

Обратите внимание: на задачах Tool calling и WikiRacing CLM-8B немного уступает Jev по точности, но выигрывает в скорости. Фигура «9x» относится именно к T-Rex, где кэширование дает максимальный эффект.

03CLM как верификатор для Coding Agents

Наибольшую практическую ценность CLM-8B показывает в роли верификатора (Verifier) для генеративных моделей. В сценарии Best-of-N, где генератор (например, Opus 5 или Fable 5) создает несколько решений, CLM выбирает лучшее. Тесты проводились на H100 с использованием fine-tuned заголовков.

Benchmark Pass@1 (CLM fine-tuned) Pass@1 (Jev) CLM Latency Jev Latency
DeepSWE 73.7% 81.6% 79 ms 449 ms
Terminal-Bench 2.1 84.0% 87.6% 32 ms 131 ms

Важный нюанс: Jev в режиме zero-shot показывает Pass@1 ниже, чем просто взятие одного случайного образца (71.1% и 83.1% соответственно). Fine-tuned CLM-8B превосходит этот базовый уровень и работает в 4-5 раз быстрее. Это делает её эффективным фильтром для отсечения плохих решений агентов.

⚠️
Важно про точность. Результаты верификации получены на held-out подмножествах (38 задач DeepSWE, 30 задач Terminal-Bench). Это не полные лидерборды, но они демонстрируют, что fine-tuned CLM эффективнее zero-shot Jev для отбора решений.

04Обучение и данные

Модель обучалась в три этапа на данных, доступных для воспроизведения:

  • Pre-training: ~60M пар вопросов-ответов из Nemotron DQA. Дает 52.1% точности.
  • Mid-training: ~30M синтетических «hard negatives» от Gemini 2.5 Flash-Lite. Поднимает точность до 69.2%.
  • Post-training: ~1M траекторий агентов (Agent Data Protocol, Endless-Terminals). Финальная донастройка.

Лицензия: Apache-2.0. Модель доступна на Hugging Face, код и данные для обучения открыты.

05Кому подойдёт / что запустится

  • Agentic Frameworks: Идеально для LangGraph, AutoGen или CrewAI, где нужно быстро ранжировать инструменты или действия без генерации текста.
  • Hardware: Требуется один GPU NVIDIA с поддержкой CUDA. RTX 4090 (24GB) достаточно для инференса. Для обучения потребуется больше VRAM (рекомендуется A100/H100 или несколько 4090).
  • Use-case: Верификация кода, выбор инструментов (tool routing), оценка безопасности действий агента.
  • Альтернативы: Если вам нужна генерация текста — смотрите Qwen3 или Llama. Если нужен только скоринг действий — CLM-8B сейчас лидер по соотношению цена/скорость среди открытых решений.

Источник: MarkTechPost ↗