Исследования15 сентября 2026 г., 08:18 МСК🤖 Auto

Vibe Patenting: LLM-судьи улучшают патенты, но не заменяют юристов

Исследование Google DeepMind показало, что LLM-судьи могут значительно повысить качество патентных заявок, но их оценки расходятся с мнением профессиональных патентных поверенных.

Баннер новости 7512

Суть эксперимента: Vibe Patenting

Команда исследователей во главе с Тосиаки Коике-Акино (Google DeepMind) представила тестовый полигон Vibe Patenting. Цель работы — оценить надежность LLM-судей (LLM Judges) при оценке сложных профессиональных задач. В отличие от простых чат-ботов, здесь используется итеративный процесс: отдельная модель-судья анализирует черновик патента, выдает структурированную обратную связь, а агент-автор вносит правки. Этот цикл повторяется до достижения нужного качества.

Ключевые метрики и результаты

Исследование показало, что итеративная обратная связь от LLM-судьи стабильно улучшает качество черновиков. Более того, этот метод позволяет «компенсировать» недостаток интеллекта у более дешевых моделей. Агенты с низким уровнем рассуждения (low-reasoning), использующие LLM-судей, приблизились к показателям значительно более дорогих моделей с высоким уровнем рассуждения (high-reasoning).

Важно отметить, что без guidance (наставления от судьи) качество генерации быстро достигает «потолка» (saturation), тогда как итеративная коррекция позволяет продолжать улучшать текст.

Сравнение с профессионалами

Самый интригующий аспект работы — валидация результатов. LLM-судьи были сопоставлены с независимой оценкой профессионального патентного поверенного. Выявлено смысловое согласие (meaningful agreement), но также обнаружены систематические различия в калибровке (calibration differences). Это означает, что LLM-судьи могут переоценивать или недооценивать определенные аспекты патента по сравнению с человеком, и их метрики не всегда линейно коррелируют с юридической значимостью документа.

Параметр Наблюдение Значение для индустрии
Итеративная правка Стабильно улучшает качество Позволяет использовать более дешевые модели для сложных задач
Без обратной связи Резкое насыщение (saturation) Одноразовая генерация неэффективна для патентов
Согласие с юристом Смысловое, но с калибровочными сдвигами LLM-судья — помощник, а не замена эксперту
Доменная специфика Agentic workflows дают прирост Нужны узкоспециализированные промпты и архитектуры

Почему это важно

Результаты Vibe Patenting подчеркивают двойственную природу LLM-судей. С одной стороны, они являются мощным сигналом оптимизации для сложных профессиональных рабочих процессов, снижая стоимость создания качественных документов. С другой стороны, исследователи предупреждают об ограничениях: слепое доверие метрикам LLM-судей без человеческой валидации может привести к юридическим рискам из-за различий в интерпретации стандартов качества.

Источник: arXiv cs.AI ↗