一篇新的研究论文提出了一种审计用作社交模拟器的大型语言模型(LLM)的方法。作者认为,仅仅将LLM生成的结果与人类结果进行匹配是不够的;底层推理过程也必须被准确模拟。他们开发了一个使用源自开放式解释的“推理状态”来评估LLM的框架,发现虽然LLM可以产生听起来合理的理由,但它们通常无法复制在人类响应中观察到的细微接受或拒绝路径。 AI
影响 这项研究引入了一种评估LLM在社交模拟任务中可靠性的新方法,有可能改进它们在合成数据生成和用户行为建模等领域的应用。
排序理由 该集群包含一篇在arXiv上发表的研究论文,详细介绍了一个新的LLM评估框架。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →