Новый стандарт эффективности: 10-кратная экономия
Лаборатория Engram совместно с юридической фирмой Harvey представила результаты тестирования AI-агентов в синтетической среде «Calderwood & Harkness» (C&H). Система использует модель Qwen 3.8 с интегрированной памятью, демонстрируя прорывные метрики по сравнению с флагманом Anthropic — Opus 4.8. Ключевое достижение: стоимость одного запроса снижена до $0.13 при показателе успешности 30%, тогда как Opus 4.8 обходится в $1.32 при успехе 25%.
Среда тестирования: 100 млн токенов реальных данных
В отличие от стандартных бенчмарков с изолированными задачами, тестовая среда C&H имитирует реальную работу юриста в постоянном файловом хранилище. Агенту необходимо ориентироваться в базе из 266 дел, 9 286 файлов и объемом данных в 100 млн токенов (эквивалент ~66 романов «Гарри Поттера»). Задача агента — находить релевантные прецеденты и документы, не перечитывая всю базу с нуля при каждом запросе.
Гибридная память: как это работает
Engram внедрила систему, сочетающую два типа памяти для оптимизации затрат и точности:
- Текстовая память (Notes): Агент самостоятельно структурирует данные, сжимая 100 млн токенов до 1 млн. Здесь хранятся четкие факты, даты закрытия сделок и статусы дел, которые легко редактировать.
- Параметрическая память (Weights): Модель «запоминает» сложные ассоциации и абстрактные структуры контрактов непосредственно в весах нейросети через дистилляцию и RL.
Такой подход позволяет Qwen 3.8 не просто искать по ключевым словам, а использовать накопленный опыт, аналогично тому, как это делают опытные юристы.
Сравнительные метрики
| Параметр | Qwen 3.8 (Engram Agent) | Opus 4.8 (Anthropic) |
|---|---|---|
| Стоимость за запрос | $0.13 | $1.32 |
| Процент успешных ответов (All-pass) | 30% | 25% |
| Экономия | В 10 раз дешевле при более высокой точности | |
Почему это важно
Результаты Engram доказывают, что масштабирование вычислений при обучении (training compute) позволяет упаковывать больше знаний в память модели, что ведет к дальнейшему снижению стоимости запросов. Для юридической отрасли это означает возможность автоматизации рутинного анализа тысяч документов без катастрофического роста затрат на API-вызовы. Система демонстрирует, что гибридный подход к памяти — ключ к созданию экономически viable AI-ассистентов для сложных профессиональных задач.
Источник: Engram ↗
