Исследования8 августа 2026 г., 07:17 МСК🤖 Auto

Локализация чисел в LLM: промпты бьют прямой перевод

Исследование Patrizia Kaye показало, что внедрение правил локализации в контекст промпта статистически значимо повышает точность перевода дат и чисел в LLM по сравнению с прямым переводом.

Баннер новости 5360

Проблема локализации в LLM

Работа Tang et al. (2025) была расширена анализом способности пяти больших языковых моделей (LLM) к локализации времени, чисел и дат. В отличие от обычного перевода, локализация требует адаптации форматов (например, DD/MM/YYYY vs MM/DD/YYYY) под целевую культуру. Исследование фокусировалось на моделях, которые можно запустить на потребительском оборудовании (commodity hardware), что делает результаты применимыми для широкого круга разработчиков.

Методология и сравнение стратегий

Авторы вычислили базовое качество для каждой модели, а затем протестировали три различные стратегии улучшения точности. Ключевым выводом стало то, что внедрение принципов локализации непосредственно в контекст промпта (prompt context) дало статистически значимое улучшение точности. Это превзошло как прямой перевод, так и альтернативные стратегии оптимизации.

Ключевые метрики и результаты

Исследование включало 7 таблиц и 2 рисунка, детально описывающих производительность. Хотя точные проценты для каждой модели в аннотации не указаны, главный вывод подтверждает: контекстуализация правил локализации внутри промпта является наиболее эффективным методом среди протестированных.

Стратегия Результат Примечание
Прямой перевод Базовый уровень Наименьшая точность локализации
Альтернативные стратегии Улучшение Ниже, чем у контекстного промпта
Локализация в промпте Статистически значимый рост Лучший метод для 5 протестированных LLM

Значение для индустрии

Результаты показывают, что для задач локализации (чисел, дат, времени) не всегда нужны сложные пайплайны пост-обработки. Правильно структурированный промпт, содержащий правила локализации, позволяет даже моделям, работающим на ограниченном оборудовании, достигать высокой точности. Это упрощает интеграцию LLM в приложения, требующие строгого соответствия локальным стандартам.

Источник: arXiv cs.CL ↗