研究人员开发了HEART-Bench,这是一个旨在评估大型语言模型(LLM)代理是否能表现出类人心理的新基准。该基准基于大五人格特质构建了11个不同的角色,每个角色拥有1000条自传式记忆。然后,这些代理将接受源自DIAMONDS分类法的64个决策场景测试,以评估其做出行为一致性选择的能力。 AI
影响 该基准可能催生出能够进行细微情感和心理反应的更复杂的大型语言模型代理。
排序理由 该集群包含一篇介绍用于评估大型语言模型代理的新基准的研究论文。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →