研究人员开发了 AlphaMWE 语料库,用于测试大型语言模型(LLMs)在机器翻译方面的能力,特别关注多词表达式(MWEs)。该研究评估了 31 个不同语言对的机器翻译系统,包括英语到中文、波兰语、德语以及几种阿拉伯语方言。使用 BLEU 和 BERT-score 等指标进行的自动评估,以及后续的人工评估,都揭示了比喻性语言和多词表达式仍然是大型语言模型的挑战,并且汇总分数可能会掩盖特定语言的错误。 AI
影响 强调了大型语言模型在细微语言翻译方面持续面临的挑战,并指出了未来模型开发的领域。
排序理由 该条目是一篇研究论文,详细介绍了新的语料库和对大型语言模型在机器翻译任务中表现的评估。[lever_c_demoted from research: ic=1 ai=1.0]
- AlphaMWE
- Arabic
- bert-score
- Bleu
- Egyptian Arabic
- English
- German
- LLMs
- machine translation
- Modern Standard Arabic
- Multiword Expressions
- Polish
- Standard Chinese
- Tunisian Arabic
- WMT2026
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →