Новый класс моделей: Контрастивные языковые модели
Команда Contrastive-LM представила CLM-8B — первую открытую модель в новом классе Contrastive Language Models (CLM). В отличие от традиционных LLM, CLM не генерирует текст. Ее задача — скоринг набора кандидатных действий на основе текущего состояния системы и возврат вероятностей. Архитектура основана на замороженном бэкбоне Qwen3-8B с добавлением обучаемой проекционной головы на 20 млн параметров. Обучение использует двунаправленную функцию потерь InfoNCE, которая притягивает состояние к реальному действию и отталкивает от остальных.
Скорость и совместимость с TypeSafe
CLM-8B спроектирована как прямая альтернатива проприетарной модели Jev от TypeSafe AI (System One). Модель поддерживает совместимый API с тремя типами запросов: Noul (проверка истинности), Choice (выбор из набора) и Score (оценка по рубрике). Модель весит всего 75 МБ (Apache-2.0 лицензия) и работает на одной NVIDIA GPU. Благодаря кэшированию векторов состояний (аналог KV-cache в vLLM), задержка при повторном посещении состояний снижается с 1.7 мс до 0.6 мс на RTX 4090.
Сравнение производительности: CLM-8B против Jev
В тестах на нулевом запросе (zero-shot) CLM-8B демонстрирует значительное преимущество в скорости, хотя в некоторых задачах уступает Jev по точности. Самый яркий разрыв — в игре T-Rex, где действия повторяются, что позволяет эффективно использовать кэширование.
| Задача | CLM-8B Latency | Jev Latency | CLM-8B Success | Jev Success |
|---|---|---|---|---|
| T-Rex game | 16.5 ms | 149.8 ms | 5/5 | 5/5 |
| Tool calling (BFCL v4) | 76.8 ms | 125.5 ms | 95.2% | 99.2% |
| WikiRacing | 79.8 ms | 225 ms | 26/30 | 30/30 |
| Super Mario | 33.5 ms | 132.6 ms | 5/5 | 5/5 |
CLM как верификатор для кодовых агентов
Особый интерес представляет использование CLM-8B в роли верификатора для генеративных моделей. В тестах на наборах DeepSWE и Terminal-Bench 2.1, fine-tuned версия CLM показала результаты, превосходящие выборку одного образца (Pass@1) и обогнавшая Jev по скорости. Это позволяет использовать CLM для эффективного отбора лучших решений из нескольких сгенерированных вариантов.
| Benchmark | Pass@1 (Baseline) | CLM (fine-tuned) | Jev | CLM Latency | Jev Latency |
|---|---|---|---|---|---|
| DeepSWE | 73.7% | 81.6% | 71.1% | 79 ms | 449 ms |
| Terminal-Bench 2.1 | 84.0% | 87.6% | 83.1% | 32 ms | 131 ms |
Процесс обучения
Модель обучалась в три этапа: предобучение на ~60 млн пар вопросов-ответов Nemotron DQA, мид-тренинг на ~30 млн синтетических «сложных негативов» от Gemini 2.5 Flash-Lite и пост-тренинг на ~1 млн траекторий агентов. Такая стратегия позволила достичь точности 69.2% на held-out вопросах после мид-тренинга, что значительно выше, чем у моделей, обученных только на сложных негативах с нуля (62.4%).
Бенчмарки
| Бенчмарк | CLM-8B | CLM-8B (fine-tuned) | Jev |
|---|---|---|---|
| DeepSWE | — | 73.7% | 81.6% |
| Terminal-Bench 2.1 | — | 84% | 87.6% |
| Tool calling (BFCL v4) | 95.2% | — | 99.2% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
