PulseAugur
实时 10:29:21
English(EN) SocietyBench: Forecasting Counterfactual Social-World Evolution

新的SocietyBench基准测试LLM对社会事件演变的预测能力

研究人员推出SocietyBench,这是一个旨在评估大型语言模型预测社会事件演变能力的新基准。该基准通过收集新闻和社交媒体帖子,将它们提炼成事实事件和公众舆论的时间线,然后生成预测问题。为了防止模型依赖预训练记忆,该基准对命名实体进行匿名化处理并调整日期,从而创建一个反事实的社会世界。早期结果显示,即使是最强大的前沿LLM也面临挑战,在概率校准和时间准确性这两个维度上得分仅为75.0/100。 AI

影响 该基准有望推动LLM在理解和预测现实世界社会动态方面能力的提升。

排序理由 该条目描述了一个用于评估LLM的新学术基准。[lever_c_demoted from research: ic=1 ai=1.0]

在 Hugging Face Daily Papers 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的SocietyBench基准测试LLM对社会事件演变的预测能力

报道来源 [1]

  1. Hugging Face Daily Papers TIER_1 English(EN) ·

    SocietyBench:预测反事实的社会-世界演变

    Large language models (LLMs), and the agents built on top of them, are now benchmarked heavily on whether they can finish a task -- fix a bug, drive a browser, operate a GUI. A complementary social ability, namely how well a model understands and forecasts the way real social eve…