PulseAugur
实时 09:23:52
English(EN) Cultivar: A Contrastive and Locale-Oriented Translation Benchmark for Investigating Contamination and Localisation Robustness

新的Cultivar基准探测AI翻译模型是否存在地区偏见

研究人员推出了Cultivar,一个旨在通过关注特定地区而非仅仅语言对来评估多语言翻译模型的新基准。这种方法旨在识别数据污染等问题,并评估模型在处理不同文化背景下的翻译效果。对32个开源模型的基准测试显示,专门从事机器翻译的模型鲁棒性较差,一些模型似乎过度拟合了现有的FLORES数据集,并且模型在源自美国的内​​容上的表现通常优于其他地区,无论目标语言如何。 AI

影响 该基准可能带来更具文化意识和更鲁棒的翻译模型,从而改善跨语言交流。

排序理由 该集群包含一篇介绍AI模型评估新基准的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的Cultivar基准探测AI翻译模型是否存在地区偏见

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Pinzhen Chen, Koel Dutta Chowdhury, Xiaoya Xu, David Tan, Doreen Osmelak, Ona de Gibert, Ariun-Erdene Tumurchuluun, Ashok Urlana, Fedor Sizov, Hale Sirin, Jesujoba Alabi, Karrar Talib Abed, Mateusz Klimaszewski, Nikolay Bogoychev, Niyati Bafna, Patricia … ·

    Cultivar:一个对比性和面向本地化的翻译基准,用于研究污染和本地化鲁棒性

    arXiv:2608.09766v1 Announce Type: cross Abstract: Multilingual translation benchmarks are typically sourced in English and translated into other languages, treating language pairs as the unit of evaluation---a design that is prone to contamination over time and overlooks locale a…