一项新近发表在arXiv上的研究评估了十五种大型语言模型(LLMs)的说服能力,发现不同的评估方法产生的结果相关性较弱。该研究将九种现有的自动化方法适配到共享设置中,并发现模型拒绝回答,尤其是在操纵任务上,显著降低了这些方法之间的一致性。通用能力也起着作用,理性说服方法能追踪通用能力,而操纵方法则不能,这表明单一的说服力分数是任务特定的,并不反映模型的整体说服力。 AI
影响 凸显了可靠评估LLM说服力所面临的挑战,影响了安全和对齐研究。
排序理由 该集群包含一篇发表在arXiv上的研究论文,详细介绍了对LLM能力的评估。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- Connected Papers
- Core Recommendations for Antifungal Stewardship: A Statement of the Mycoses Study Group Education and Research Consortium
- DagsHub
- Gotit.pub
- Hugging Face
- Kamile Dementaviciute
- Litmaps
- ScienceCast
- scite Smart Citations
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →