PulseAugur
实时 09:45:03
English(EN) SocietyBench: Forecasting Counterfactual Social-World Evolution

新的SocietyBench基准测试LLM预测反事实社会事件的能力

研究人员推出SocietyBench,这是一个新颖的基准,旨在评估大型语言模型(LLM)预测反事实社会世界演变的能力。与专注于任务完成的现有基准不同,SocietyBench通过呈现事实事件和公众舆论的时间线,然后提出预测问题来评估LLM对社会动态的理解。为防止模型依赖预训练记忆,对命名实体和日期进行了修改,创建了结构相似但反事实的场景。该基准包括中文和英文版本,最强的LLM在两个正交轴上(概率校准和时间准确性)仅获得100分中的75.0分,表明当前LLM能力存在显著差距。 AI

影响 该基准可以推动LLM在复杂社会场景中提高推理和预测能力。

排序理由 该集群描述了一篇介绍用于评估LLM的新颖基准的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的SocietyBench基准测试LLM预测反事实社会事件的能力

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Zhenran Wang, Zhonghan Bian, Jinsong Li, Zhangyang Qi ·

    SocietyBench: Forecasting Counterfactual Social-World Evolution

    arXiv:2608.04009v1 Announce Type: new Abstract: Large language models (LLMs), and the agents built on top of them, are now benchmarked heavily on whether they can finish a task -- fix a bug, drive a browser, operate a GUI. A complementary social ability, namely how well a model u…