Релиз модели24 августа 2026 г., 04:18 МСК🤖 Auto

Harvey Tenet: Post-training Kimi K3 для юридических агентов

Harvey представила первую модель Tenet на базе Kimi K3, обученную асинхронным RL для долгих юридических задач. Модель показала рост точности на 9-20% по сравнению с базовой версией.

Баннер новости 6353

Суть инновации: от базы к агенту

Компания Harvey выпустила Harvey Tenet — первую модель с пост-обучением (post-trained), созданную на базе открытой модели Kimi K3 совместно с платформой Fireworks. В отличие от стандартных LLM, Tenet оптимизирована для «долгих» (long-horizon) сценариев работы юридических агентов с использованием асинхронного обучения с подкреплением (RL). Корпус данных включал синтетические данные, публичные юридические тексты и экспертные оценки, при этом использование клиентских данных исключено.

Ключевые метрики и бенчмарки

По сравнению с базовой моделью Kimi K3, Tenet демонстрирует значительный прирост эффективности в специализированных задачах. Модель достигла состояния передового уровня (SOTA) на собственном бенчмарке Harvey LAB: Contracts и заняла второе место в общем зачете LAB. Ниже приведено сравнение результатов:

Метрика / Бенчмарк Результат Kimi K3 (Base) Результат Harvey Tenet Прирост / Примечание
Legal Agent Benchmark (LAB) Базовый уровень ~2x больше выполненных задач Рост all-pass rate на +9 п.п.
LAB: Contracts Базовый уровень SOTA (State-of-the-Art) Рост all-pass rate на +2 п.п.
Mercor APEX Agents 58.8% 67.5% Значительное улучшение без дообучения
Crosby Redline Bench Информация недостаточна Улучшение Результаты не опубликованы публично

Технические детали обучения

Процесс обучения потребовал около 150 GPU NVIDIA B300 в течение двух месяцев. Использовался алгоритм GSPO с адаптерами LoRA (rank-64) поверх полной сети K3. Обучение проходило в песочницах, имитирующих работу юриста: от 50 до 1000+ шагов (turns) на один кейс. Оценка качества осуществлялась через LLM-as-a-judge (на базе Kimi 2.6), где вознаграждение зависело от выполнения атомарных критериев успеха.

Специализированные подмодели

Harvey также представила три специализированные модели, которые Tenet может использовать как инструменты:

  • M&A Diligence: Обработка датарумов до 80M токенов. Проходимость критериев выросла с 43.8% до 60.1%.
  • Review Table: Анализ таблиц с цитированием. Качество ответов выросло на 3.6 балла, а стоимость обработки снизилась в 10 раз.
  • Firm Knowledge (Engram): Модель Qwen3.8-27B для структурирования знаний фирмы. Интеллектуальная эффективность (intelligence-per-token) достигла 190.8, а стоимость запроса упала на 90%.

Статус релиза и доступность

На данный момент Harvey Tenet доступна как research preview (превью для исследований). Веса модели не опубликованы, API не предоставлено. Доступ к функционалу осуществляется через платформу Harvey для юридических фирм и корпоративных юридических отделов. Компания планирует перевести технологию в продакшн в своих продуктах в ближайшее время, позиционируя это как путь к созданию собственных специализированных моделей для юридических компаний.

Бенчмарки

БенчмаркHarvey TenetHarvey Tenet (post-trained)Baseline (GLM-5.2)Kimi K3 base
Legal Agent Benchmark (LAB)0%0%
APEX Agents67.5%58.8%
PRBench hard subset36.8%36%
LAB: Diligence60.1%43.8%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: MarkTechPost ↗