研究人员推出SocietyBench,这是一个新颖的基准,旨在评估大型语言模型(LLM)预测反事实社会世界演变的能力。与专注于任务完成的现有基准不同,SocietyBench通过呈现事实事件和公众舆论的时间线,然后提出预测问题来评估LLM对社会动态的理解。为防止模型依赖预训练记忆,对命名实体和日期进行了修改,创建了结构相似但反事实的场景。该基准包括中文和英文版本,最强的LLM在两个正交轴上(概率校准和时间准确性)仅获得100分中的75.0分,表明当前LLM能力存在显著差距。 AI
影响 该基准可以推动LLM在复杂社会场景中提高推理和预测能力。
排序理由 该集群描述了一篇介绍用于评估LLM的新颖基准的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →