研究人员推出了 DeepSurvey-Bench,这是一个旨在评估自动生成的科学调查的学术价值的新基准。现有的基准通常依赖于引用次数等肤浅的标准,这些标准不能完全捕捉调查的真正学术价值。DeepSurvey-Bench 通过纳入信息价值、学术交流价值和研究指导价值等维度来解决这一问题。该基准使用一个为学术价值进行了标注的数据集,并采用多 LLM 作为裁判的方法来评估生成的调查,证明比以前的方法更接近人类评估。 AI
影响 为评估人工智能生成的学术内容提供了一种更稳健的方法,有可能改进未来的调查生成模型。
排序理由 该集群描述了一个新的学术基准和相关论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →