<div>
<p>Команда исследователей представила TransEvalnia — систему, которая заставляет большие языковые модели критически оценивать переводы на уровне, близком к человеческому.</p>
<p>Как это работает? TransEvalnia использует цепочку продуманных «подсказок» (prompting), чтобы попросить ИИ подробно разобрать перевод по ключевым критериям из Multidimensional Quality Metrics. В результате вы получаете не просто общий балл, а развернутый отчёт по каждому аспекту — от точности терминов до плавности фразы.</p>
<p>Результаты впечатляют: на данных английский–японский и других языковых парах WMT система показала оценку не хуже, а порой и лучше, чем передовой MT-Ranker от Moosa et al. (2024). Представляете? ИИ сам указывает, какой перевод лучше, а какой требует доработки.</p>
<p>Под капотом работают Anthropic Claude-3.5-Sonnet и Qwen-2.5-72B-Instruct. Они не только выставляют оценки, но и высказывают свои «мысли», объясняя, почему один вариант перевода предпочтительнее другого.</p>
<p>При этом авторы обратили внимание на смещение из-за порядка подачи вариантов. Для борьбы с этим они предложили алгоритмы перемешивания и усреднения выводов, чтобы итоговая оценка оставалась справедливой независимо от позиции перевода.</p>
<p>Код, датасеты и логика рассуждений доступны в открытом доступе, так что любой желающий может повторить эксперименты или адаптировать подход для своих задач.</p>
</div>
AI-новости1 августа 2025 г., 14:14 МСК🤖 Auto
TransEvalnia: ИИ-оценка переводов нового уровня
<p> TransEvalnia научит ИИ давать детальные, человекоподобные оценки переводов по множеству критериев — и превзойдёт передовые системы ранжирования.</p>