发布了两个新的基准测试CausalVerify和CausalBN-Bench,用于评估大型语言模型(LLM)的因果推断能力。CausalVerify侧重于结构化计量经济学工作流,测试LLM是否能执行代码从合成数据中恢复正确的因果估计,结果显示模型之间存在显著差异,并且执行基础的正确性与基于文本的评分之间存在差距。另一方面,CausalBN-Bench在相关性、因果骨架和因果识别任务上评估LLM,发现虽然闭源模型在简单关系方面显示出潜力,但在大型网络上落后于传统算法,并且倾向于通过语义关联而非直接上下文或数值分析来理解因果关系。 AI
影响 这些基准测试将推动改进LLM因果关系理解的研究,这对于可靠的推理和解释至关重要。
排序理由 该集群包含两篇介绍用于评估LLM能力基准测试的学术论文。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →