Суть инновации: от базы к агенту
Компания Harvey выпустила Harvey Tenet — первую модель с пост-обучением (post-trained), созданную на базе открытой модели Kimi K3 совместно с платформой Fireworks. В отличие от стандартных LLM, Tenet оптимизирована для «долгих» (long-horizon) сценариев работы юридических агентов с использованием асинхронного обучения с подкреплением (RL). Корпус данных включал синтетические данные, публичные юридические тексты и экспертные оценки, при этом использование клиентских данных исключено.
Ключевые метрики и бенчмарки
По сравнению с базовой моделью Kimi K3, Tenet демонстрирует значительный прирост эффективности в специализированных задачах. Модель достигла состояния передового уровня (SOTA) на собственном бенчмарке Harvey LAB: Contracts и заняла второе место в общем зачете LAB. Ниже приведено сравнение результатов:
| Метрика / Бенчмарк | Результат Kimi K3 (Base) | Результат Harvey Tenet | Прирост / Примечание |
|---|---|---|---|
| Legal Agent Benchmark (LAB) | Базовый уровень | ~2x больше выполненных задач | Рост all-pass rate на +9 п.п. |
| LAB: Contracts | Базовый уровень | SOTA (State-of-the-Art) | Рост all-pass rate на +2 п.п. |
| Mercor APEX Agents | 58.8% | 67.5% | Значительное улучшение без дообучения |
| Crosby Redline Bench | Информация недостаточна | Улучшение | Результаты не опубликованы публично |
Технические детали обучения
Процесс обучения потребовал около 150 GPU NVIDIA B300 в течение двух месяцев. Использовался алгоритм GSPO с адаптерами LoRA (rank-64) поверх полной сети K3. Обучение проходило в песочницах, имитирующих работу юриста: от 50 до 1000+ шагов (turns) на один кейс. Оценка качества осуществлялась через LLM-as-a-judge (на базе Kimi 2.6), где вознаграждение зависело от выполнения атомарных критериев успеха.
Специализированные подмодели
Harvey также представила три специализированные модели, которые Tenet может использовать как инструменты:
- M&A Diligence: Обработка датарумов до 80M токенов. Проходимость критериев выросла с 43.8% до 60.1%.
- Review Table: Анализ таблиц с цитированием. Качество ответов выросло на 3.6 балла, а стоимость обработки снизилась в 10 раз.
- Firm Knowledge (Engram): Модель Qwen3.8-27B для структурирования знаний фирмы. Интеллектуальная эффективность (intelligence-per-token) достигла 190.8, а стоимость запроса упала на 90%.
Статус релиза и доступность
На данный момент Harvey Tenet доступна как research preview (превью для исследований). Веса модели не опубликованы, API не предоставлено. Доступ к функционалу осуществляется через платформу Harvey для юридических фирм и корпоративных юридических отделов. Компания планирует перевести технологию в продакшн в своих продуктах в ближайшее время, позиционируя это как путь к созданию собственных специализированных моделей для юридических компаний.
Бенчмарки
| Бенчмарк | Harvey Tenet | Harvey Tenet (post-trained) | Baseline (GLM-5.2) | Kimi K3 base |
|---|---|---|---|---|
| Legal Agent Benchmark (LAB) | 0% | — | — | 0% |
| APEX Agents | 67.5% | — | — | 58.8% |
| PRBench hard subset | 36.8% | — | — | 36% |
| LAB: Diligence | — | 60.1% | 43.8% | — |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
