一项新的研究论文探讨了大型语言模型(LLMs)在理解和生成中文歇后语方面的推理与记忆能力。研究人员创建了新的歇后语以避免数据污染,并发现尽管前沿的中文模型在现有歇后语上的准确率高于以英语为中心的模型,这表明中文数据集更大,但它们在新的歇后语上的表现仍远低于人类专家。然而,Gemini 3.1 Pro在新的歇后语上表现出92.6%的显著准确率,比人类准确率高出24%。尽管如此,大型语言模型生成的歇后语的评分仍低于人类创作的歇后语,这表明其创意能力存在局限性。 AI
影响 强调了由于数据污染可能高估了大型语言模型的推理和创造力,敦促仔细重新审视模型的能力。
排序理由 一篇发表在arXiv上的研究论文,评估了大型语言模型在特定语言任务上的能力。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- Chinese Xiehouyu Riddles
- DagsHub
- Gemini 3.1 Pro
- Gotit.pub
- Hugging Face
- human
- LLMs
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →