研究人员推出了 CNeo-Bench,这是一个旨在评估大型语言模型 (LLM) 对中文新词的理解和处理能力的新基准。该基准包含 4,759 个新词,并根据其语言机制进行分类,例如语音替换和视觉字符分解。对 18 个大型语言模型的初步评估显示,大多数模型在生成这些新词的准确定义方面存在困难,准确率通常低于 40%。在模型描述新词的能力与其在特定任务中重现原始新词的能力之间观察到一个显著差距,这表明存在超越简单提示的挑战。 AI
影响 突出了大型语言模型在特定语言方面面临的挑战,可能为未来非英语语言的模型开发和评估提供指导。
排序理由 该集群描述了一个用于评估大型语言模型在特定语言挑战方面表现的新学术基准,该基准发表在 arXiv 论文中。 [lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →