一个名为 DecisionQE 的新框架已被开发出来,用于衡量大型语言模型 (LLM) 在群体决策场景中的说服力和顺从性倾向。研究人员使用“狼人杀”游戏作为测试平台,发现虽然说服性倾向并未显著改善群体结果,但顺从性模型在合作方面显示出更稳定的优势。该研究表明,LLM 可以为语言介导的交互的社会学观察提供见解,并强调了将行为倾向纳入 LLM 安全评估的重要性。 AI
影响 这项研究可能通过量化 LLM 在社交互动中的行为倾向,从而实现更强大的 LLM 安全评估。
排序理由 该集群包含一篇详细介绍 LLM 行为评估新框架的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- DecisionQE
- Gotit.pub
- Humans
- Hugging Face
- Language Models
- ScienceCast
- Werewolf game
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →