研究人员开发了一个新颖的基准,使用多代理框架来评估大型语言模型(LLM)的审议能力,该框架的灵感来源于电影《十二怒汉》。该研究测试了GPT-4o和Llama-4-Scout,发现大多数模拟都导致了悬而未决的陪审团(hung juries),表明存在锚定效应而非说服力。与GPT-4o相比,Llama-4-Scout表现出更大的审议灵活性和更高的投票变化次数,这表明强化学习从人类反馈(RLHF)对齐训练的强度,而不是原始能力,影响了这种灵活性。 AI
影响 这项研究表明,当前的LLM可能难以进行细致的审议和说服,这可能会影响它们在复杂决策场景中的应用。
排序理由 这是一篇发表在arXiv上的研究论文,详细介绍了一种评估LLM的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →