研究人员推出SocietyBench,这是一个旨在评估大型语言模型预测社会事件演变能力的新基准。该基准通过收集新闻和社交媒体帖子,将它们提炼成事实事件和公众舆论的时间线,然后生成预测问题。为了防止模型依赖预训练记忆,该基准对命名实体进行匿名化处理并调整日期,从而创建一个反事实的社会世界。早期结果显示,即使是最强大的前沿LLM也面临挑战,在概率校准和时间准确性这两个维度上得分仅为75.0/100。 AI
影响 该基准有望推动LLM在理解和预测现实世界社会动态方面能力的提升。
排序理由 该条目描述了一个用于评估LLM的新学术基准。[lever_c_demoted from research: ic=1 ai=1.0]
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →