Релиз модели24 сентября 2026 г., 10:17 МСК🤖 Auto

CLM-8B: Открытая модель для агентов, работающая в 9 раз быстрее Jev

Contrastive-LM выпустила CLM-8B — первую открытую модель класса Contrastive Language Models, которая оценивает действия агентов, а не генерирует текст. В тестах она обходит проприетарный аналог Jev по скорости до 9x.

Баннер новости 8169

Новый класс моделей: Контрастивные языковые модели

Команда Contrastive-LM представила CLM-8B — первую открытую модель в новом классе Contrastive Language Models (CLM). В отличие от традиционных LLM, CLM не генерирует текст. Ее задача — скоринг набора кандидатных действий на основе текущего состояния системы и возврат вероятностей. Архитектура основана на замороженном бэкбоне Qwen3-8B с добавлением обучаемой проекционной головы на 20 млн параметров. Обучение использует двунаправленную функцию потерь InfoNCE, которая притягивает состояние к реальному действию и отталкивает от остальных.

Скорость и совместимость с TypeSafe

CLM-8B спроектирована как прямая альтернатива проприетарной модели Jev от TypeSafe AI (System One). Модель поддерживает совместимый API с тремя типами запросов: Noul (проверка истинности), Choice (выбор из набора) и Score (оценка по рубрике). Модель весит всего 75 МБ (Apache-2.0 лицензия) и работает на одной NVIDIA GPU. Благодаря кэшированию векторов состояний (аналог KV-cache в vLLM), задержка при повторном посещении состояний снижается с 1.7 мс до 0.6 мс на RTX 4090.

Сравнение производительности: CLM-8B против Jev

В тестах на нулевом запросе (zero-shot) CLM-8B демонстрирует значительное преимущество в скорости, хотя в некоторых задачах уступает Jev по точности. Самый яркий разрыв — в игре T-Rex, где действия повторяются, что позволяет эффективно использовать кэширование.

Задача CLM-8B Latency Jev Latency CLM-8B Success Jev Success
T-Rex game 16.5 ms 149.8 ms 5/5 5/5
Tool calling (BFCL v4) 76.8 ms 125.5 ms 95.2% 99.2%
WikiRacing 79.8 ms 225 ms 26/30 30/30
Super Mario 33.5 ms 132.6 ms 5/5 5/5

CLM как верификатор для кодовых агентов

Особый интерес представляет использование CLM-8B в роли верификатора для генеративных моделей. В тестах на наборах DeepSWE и Terminal-Bench 2.1, fine-tuned версия CLM показала результаты, превосходящие выборку одного образца (Pass@1) и обогнавшая Jev по скорости. Это позволяет использовать CLM для эффективного отбора лучших решений из нескольких сгенерированных вариантов.

Benchmark Pass@1 (Baseline) CLM (fine-tuned) Jev CLM Latency Jev Latency
DeepSWE 73.7% 81.6% 71.1% 79 ms 449 ms
Terminal-Bench 2.1 84.0% 87.6% 83.1% 32 ms 131 ms

Процесс обучения

Модель обучалась в три этапа: предобучение на ~60 млн пар вопросов-ответов Nemotron DQA, мид-тренинг на ~30 млн синтетических «сложных негативов» от Gemini 2.5 Flash-Lite и пост-тренинг на ~1 млн траекторий агентов. Такая стратегия позволила достичь точности 69.2% на held-out вопросах после мид-тренинга, что значительно выше, чем у моделей, обученных только на сложных негативах с нуля (62.4%).

Бенчмарки

БенчмаркCLM-8BCLM-8B (fine-tuned)Jev
DeepSWE—73.7%81.6%
Terminal-Bench 2.1—84%87.6%
Tool calling (BFCL v4)95.2%—99.2%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: MarkTechPost ↗