Проблема надежности без валидности
В области компьютерной лингвистики (cs.CL) и искусственного интеллекта (cs.AI) существует серьезный методологический разрыв. Когда большая языковая модель (LLM) присваивает тексту тот же код, что и человек-аннотатор, это гарантирует надежность (reliability), но не конструктную валидность (construct validity). Модель может быть «теоретически неграмотной» (theory-naive): она достигает правильного ответа, используя корреляты, которые не соответствуют требованиям теории измеряемого конструкта. Текущие методы не позволяют отличить такое «случайное совпадение» от истинного измерения.
Решение: Grain Calibration
Автор статьи Мануэль Пита (Manuel Pita) предлагает метод grain calibration (зеркальная калибровка). Этот подход закрывает разрыв между надежностью и валидностью, декомпозируя конструкт на уровне предложений (clause-level components). Процесс включает три ключевых этапа:
- Декомпозиция: Разбиение сложного конструкта на логические компоненты.
- Извлечение доказательств: Тестирование каждого компонента против текста с использованием извлекаемых доказательств (extractive evidence).
- Явное правило: Комбинация результатов через правило, выведенное из теории, а не спрятанное в «черном ящике» одного прохода модели.
Почему это важно для валидации
Ключевое отличие метода grain calibration заключается в том, что структура правила становится доказательством процесса, а не только результата. Это позволяет:
- Точно определить, какой именно компонент решил код.
- В случае ошибки диагностировать причину: был ли пропущен компонент или соседний конструкт был ошибочно принят за измеряемый.
Валидация смещается с простого сравнения выходов инструмента с аннотатором на демонстрацию того, что инструмент работает именно на том конструкте, который предписывает теория.
| Аспект | Традиционная валидация (Agreement) | Grain Calibration (Pita, 2026) |
|---|---|---|
| Фокус | Совпадение кода с аннотатором | Соответствие теоретическим требованиям |
| Механизм | Однократный проход (opaque pass) | Декомпозиция на компоненты + явные правила |
| Диагностика ошибок | Невозможна (только факт ошибки) | Выявление пропущенных или ложных конструктов |
| Валидность | Не гарантирована (риск theory-naive) | Обеспечена через структуру процесса |
Статья опубликована 26 июня 2026 года в препринте arXiv:2606.28574 и охватывает темы cs.CL, cs.AI и cs.CY, предлагая новый стандарт для оценки ИИ как измерительных инструментов.
Источник: arXiv cs.CL ↗
