一项发表在arXiv上的新研究介绍了一个名为Persuasio的平台,该平台旨在评估大型语言模型(LLMs)的说服性对话能力。研究人员围绕一个英国政治话题生成了192场辩论,让真人与大型语言模型进行对抗。研究结果表明,大型语言模型被感知的说服力与其真实的论证能力之间存在显著差距,尽管大型语言模型在主观排名中占主导地位,但在正式裁决中真人仍然具有竞争力。 AI
影响 突显了大型语言模型的流畅表达与其逻辑推理之间可能存在的脱节,表明当前模型在正式论证方面的能力可能不如它们看起来那么强。
排序理由 发表在arXiv上的研究论文,详细介绍了一种评估大型语言模型的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →