研究人员开发了 TeochewBench,一个旨在评估大型语言模型潮州语言翻译能力的新基准。该基准包含 300 个潮州汉字表达,由母语者审阅,涵盖了从基本词汇到习语的各种语言复杂性。初步评估显示,Qwen3.5-27B 等模型表现最佳,但所有模型在高度特异性和习语表达方面都遇到困难,这表明翻译细致的潮州语言存在重大挑战。 AI
影响 强调了需要专门的基准来提高大型语言模型在低资源语言和细致语言表达方面的性能。
排序理由 该项目描述了一个用于评估大型语言模型特定语言翻译能力的新学术基准。[lever_c_demoted from research: ic=1 ai=1.0]
- English
- Gemma 3 27B IT
- GLM-4-32B-0414
- Hugging Face
- Qwen2.5-72B-Instruct
- Qwen3.5-27B
- Standard Chinese
- TeochewBench
- Teochew Hanzi
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →