Проблема «перекоррекции» в LLM
Задача грамматической коррекции ошибок (GEC) с ограничением на минимальные правки остается сложной для больших языковых моделей (LLM) в режимах zero- и few-shot. Стандартные промпты часто приводят к систематической «перекоррекции» (overcorrection): модель исправляет уже грамотные фрагменты текста, что снижает метрику качества $F_{0.5}$. Традиционное решение — дообучение (fine-tuning) — требует значительных инфраструктурных ресурсов, что недоступно многим разработчикам.
Три ключевых инновации метода
Авторы Kateryna Karpo и Artem Chernodub предлагают обходной путь, не требующий переобучения моделей. Их подход базируется на трех столпах:
- Таксономия инструкций: В промпт включен исчерпывающий список правил грамматики. Это задает модели «ограниченную область» (bounded scope), сопоставимую с метриками оценки, заставляя LLM исправлять только конкретные ошибки.
- Batching как регуляризатор: Объединение нескольких предложений в один контекст (batching) снижает уровень правок. Авторы объясняют это эффектом «разбавления внимания» (attention dilution): из-за ограниченной емкости механизмов self-attention модель становится менее склонной к избыточным изменениям.
- LLM-assisted Prompt Optimization: Оптимизация самих инструкций проводится с помощью мощной модели Gemini 3.1-Pro, что позволяет тонко настроить формулировки для лучшего понимания.
Результаты: новый SOTA для prompt-based подходов
Предложенный метод показал выдающиеся результаты на тестовом наборе BEA-2019. Метрика $F_{0.5}$ достигла значения 78.32, что устанавливает новый стандарт (SOTA) для подходов, основанных только на промптах. Важно, что этот результат сокращает разрыв с лучшим дообученным решением (Staruch et al., 2025) всего до 0.38 балла.
| Метрика / Параметр | Значение | Примечание |
|---|---|---|
| Метрика $F_{0.5}$ (BEA-2019) | 78.32 | Новый SOTA для prompt-based GEC |
| Разрыв до Fine-tuned SOTA | 0.38 | Разница с лучшей дообученной моделью (Staruch et al., 2025) |
| Инструмент оптимизации | Gemini 3.1-Pro | Использован для настройки промптов |
| Ключевой эффект | Снижение edit rate | Достигается за счет batching и таксономии правил |
Значение для индустрии
Публикация принята в Findings of EMNLP 2026. Доступность кода и промптов позволяет разработчикам внедрять высококачественную коррекцию текста без затрат на тренировку собственных моделей, используя лишь мощные API-интерфейсы LLM.
Источник: arXiv cs.CL ↗
