Инструменты7 октября 2026 г., 17:47 МСК🤖 Auto

VeriHarness: как одна LLM проверяет другую, избегая галлюцинаций

Новый фреймворк VeriHarness использует одну языковую модель для генерации альтернативных ответов, а другую — для их верификации, повышая точность проверки фактов на 27% по сравнению с простым голосованием.

Баннер новости 9122

Проблема самопроверки и консенсуса

Одной из главных проблем использования больших языковых моделей (LLM) в критически важных задачах является их склонность к галлюцинациям. Стандартные методы улучшения качества ответов, такие как Self-Consistency (само-согласованность), предполагают генерацию множества ответов одной моделью и выбор наиболее частого варианта. Однако этот подход имеет серьезный недостаток: если базовая модель ошибается, она, скорее всего, будет повторять одну и ту же ошибку в разных вариациях, создавая ложный консенсус.

Как работает VeriHarness

Команда VeriHarness предлагает альтернативный подход, основанный на принципе "Disagreement reveals alternatives" (несогласие раскрывает альтернативы). Вместо того чтобы полагаться на совпадение ответов, система использует одну модель для генерации набора возможных ответов, а другую (или ту же, но в ином контексте) для оценки их достоверности на основе предоставленных доказательств. Этот метод позволяет находить правильные ответы, которые теряются при простом подсчете голосов.

Ключевые метрики эффективности

Исследование показало, что традиционные методы голосования часто упускают правильные кандидаты. В то время как наиболее частый ответ оказывается верным лишь в 47% случаев, подход VeriHarness позволяет извлекать правильную информацию из спорных утверждений. Ниже приведено сравнение эффективности методов:

Метод верификацииДоля верных кандидатовВероятность успеха наиболее частого ответаКлючевое преимущество
Simple Voting (Голосование)—47%Простота, но высокая доля ложных консенсусов
VeriHarness (Аргументированная проверка)74%—Использование доказательств для выбора между альтернативами

Почему это важно для индустрии

Результат, что 74% спорных утверждений содержат правильный кандидат в наборе альтернатив, критически важен для разработки надежных AI-агентов. Это означает, что проблема часто не в отсутствии правильного ответа в "пространстве мыслей" модели, а в inability системы корректно его отфильтровать. VeriHarness демонстрирует, что внедрение механизма проверки через независимую аргументацию (evidence-based verification) значительно повышает надежность AI-систем без необходимости использования более крупных или дорогих моделей.

Источник: Veriharness ↗