Исследования30 июня 2026 г., 19:19 МСК🤖 Auto

Зеркальная калибровка: как проверить LLM на валидность, а не просто на совпадение

Исследователь Мануэль Пита предлагает метод grain calibration, который отличает истинное понимание теории от случайного угадывания кодов в LLM, закрывая критический пробел в валидации ИИ.

Баннер новости 2584

Проблема надежности без валидности

В области компьютерной лингвистики (cs.CL) и искусственного интеллекта (cs.AI) существует серьезный методологический разрыв. Когда большая языковая модель (LLM) присваивает тексту тот же код, что и человек-аннотатор, это гарантирует надежность (reliability), но не конструктную валидность (construct validity). Модель может быть «теоретически неграмотной» (theory-naive): она достигает правильного ответа, используя корреляты, которые не соответствуют требованиям теории измеряемого конструкта. Текущие методы не позволяют отличить такое «случайное совпадение» от истинного измерения.

Решение: Grain Calibration

Автор статьи Мануэль Пита (Manuel Pita) предлагает метод grain calibration (зеркальная калибровка). Этот подход закрывает разрыв между надежностью и валидностью, декомпозируя конструкт на уровне предложений (clause-level components). Процесс включает три ключевых этапа:

  • Декомпозиция: Разбиение сложного конструкта на логические компоненты.
  • Извлечение доказательств: Тестирование каждого компонента против текста с использованием извлекаемых доказательств (extractive evidence).
  • Явное правило: Комбинация результатов через правило, выведенное из теории, а не спрятанное в «черном ящике» одного прохода модели.

Почему это важно для валидации

Ключевое отличие метода grain calibration заключается в том, что структура правила становится доказательством процесса, а не только результата. Это позволяет:

  1. Точно определить, какой именно компонент решил код.
  2. В случае ошибки диагностировать причину: был ли пропущен компонент или соседний конструкт был ошибочно принят за измеряемый.

Валидация смещается с простого сравнения выходов инструмента с аннотатором на демонстрацию того, что инструмент работает именно на том конструкте, который предписывает теория.

Аспект Традиционная валидация (Agreement) Grain Calibration (Pita, 2026)
Фокус Совпадение кода с аннотатором Соответствие теоретическим требованиям
Механизм Однократный проход (opaque pass) Декомпозиция на компоненты + явные правила
Диагностика ошибок Невозможна (только факт ошибки) Выявление пропущенных или ложных конструктов
Валидность Не гарантирована (риск theory-naive) Обеспечена через структуру процесса

Статья опубликована 26 июня 2026 года в препринте arXiv:2606.28574 и охватывает темы cs.CL, cs.AI и cs.CY, предлагая новый стандарт для оценки ИИ как измерительных инструментов.

Источник: arXiv cs.CL ↗