От «идеального ученика» к реалистичной модели
Классическая парадигма language identification in the limit (идентификация языка в пределе) рассматривала обучение как игру, где алгоритм должен точно определить целевой язык. Однако современные LLM работают иначе: их цель — генерировать новые, но валидные строки. Исследование «Generating in the Limit with Infinitely Many Hallucinations» (Strauss, Butoi, Cotterell, 2026) вводит новую метрику точности, переосмысливая классический компромисс между полнотой (recall) и точностью (precision).
Ключевое открытие: бесконечные галлюцинации
Авторы предлагают радикальное допущение: алгоритм генерации может совершать бесконечное количество ошибок (галлюцинаций), при условии, что частота этих ошибок стремится к нулю. В таком сценарии точность (precision) формально остается равной единице, так как доля правильных ответов в пределе доминирует. Это позволяет алгоритму охватить значительно большую часть целевого языка (recall), особенно если «противник» (адверсарий) скрывает значительную часть данных.
Сравнение подходов к оценке
Традиционные метрики часто наказывают модели за повторения или редкие ошибки, игнорируя контекст масштабирования. Ниже приведено сравнение подходов:
| Параметр | Классический подход | Новая модель (2026) |
|---|---|---|
| Допустимые ошибки | Стремление к нулю ошибок в конце | Бесконечное число ошибок, но частость → 0 |
| Новизна (Novelty) | Жесткое требование уникальности | Непрерывное релаксирование: требуется лишь фиксированная доля новых строк |
| Цель | Точная идентификация языка | Генерация валидных, но не обязательно уникальных строк |
Почему это важно для индустрии
Результаты работы показывают, что требование абсолютной валидности каждой сгенерированной строки искусственно ограничивает способность модели к креативному охвату пространства решений. Для разработчиков LLM это означает:
- Необходимость пересмотра метрик оценки, учитывающих динамику ошибок, а не только их конечное количество.
- Признание того, что «шум» в генерации — это не баг, а неизбежная часть процесса обучения в условиях неполных данных.
- Сдвиг фокуса с борьбы за 100% точность на контроль частоты галлюцинаций в долгосрочной перспективе.
Работа открывает путь к более реалистичным моделям языка, где редкие ошибки и повторения контролируются, но не исключаются полностью, что ближе к человеческому когнитивному процессу.
Источник: arXiv cs.CL ↗
