PulseAugur
实时 13:08:08
English(EN) Reasoning or Memorization: Can LLMs Understand and Generate Chinese Xiehouyu Riddles?

尽管Gemini 3.1 Pro表现强劲,但大型语言模型在创意歇后语生成方面仍面临挑战

一项新的研究论文探讨了大型语言模型(LLMs)在理解和生成中文歇后语方面的推理与记忆能力。研究人员创建了新的歇后语以避免数据污染,并发现尽管前沿的中文模型在现有歇后语上的准确率高于以英语为中心的模型,这表明中文数据集更大,但它们在新的歇后语上的表现仍远低于人类专家。然而,Gemini 3.1 Pro在新的歇后语上表现出92.6%的显著准确率,比人类准确率高出24%。尽管如此,大型语言模型生成的歇后语的评分仍低于人类创作的歇后语,这表明其创意能力存在局限性。 AI

影响 强调了由于数据污染可能高估了大型语言模型的推理和创造力,敦促仔细重新审视模型的能力。

排序理由 一篇发表在arXiv上的研究论文,评估了大型语言模型在特定语言任务上的能力。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

尽管Gemini 3.1 Pro表现强劲,但大型语言模型在创意歇后语生成方面仍面临挑战

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Hai Hu, Siyuan Song, Chongtian Shao, Kejia Zhang, Tianjian Zhu, Xiaojing Zhao ·

    Reasoning or Memorization: Can LLMs Understand and Generate Chinese Xiehouyu Riddles?

    arXiv:2607.23440v1 Announce Type: cross Abstract: In this paper, we push the boundary of LLM reasoning by testing them in a Chinese language game, xiehouyu, with novel xiehouyu created by linguists that had not existed before to avoid data contamination. We use multiple-choice qu…