研究人员推出了SurveyReview,这是一个新的基准和数据集,旨在评估大型语言模型(LLM)作为调查评估员时的表现。该基准解决了现有LLM作为裁判方法中与人类审稿人系统性对齐的不足。SurveyReview包含675篇带注释的调查论文和1,630份审稿报告,分为四个维度的评分和理由。一个名为SurveyAlign的基线评估器,在Qwen3-32B上进行了微调,与GPT-5.2相比,在审稿人对齐方面表现出显著的改进,降低了均方误差和平均绝对误差。 AI
影响 该基准有望提高基于LLM的调查研究评估的可靠性,从而提高学术同行评审过程的质量和效率。
排序理由 该项目描述了一篇介绍用于评估LLM的基准和数据集的新学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →