研究人员开发了一个新的基准测试,用于评估大型语言模型(LLMs)在中国网络评论中理解社交语用推理的能力。该基准测试由超过20万次社交媒体互动构成,包含4,735个经过人类验证的项目,旨在测试模型是否能在对话语境中区分评论的合理解读。这项任务被证明具有挑战性,在“留作者在外”的设置下,表现最佳的模型准确率达到了81.42%,远低于人类90.8%的准确率。分析显示,虽然模型通常能检测到普遍的讽刺或俏皮,但它们难以识别这些细微之处背后的具体互动行为或机制。 AI
影响 该基准测试有望推动LLM在理解自然语言中微妙的社交线索和语境方面的能力得到提升,从而增强它们在现实交流场景中的效用。
排序理由 该条目描述了一个用于评估LLM在特定NLP任务上的新基准测试,发布在arXiv上。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →