一项新近发表在arXiv上的研究调查了不同的审稿人指南设计如何影响基于大语言模型(LLM)的自动化同行评审的有效性。研究发现,通过既定实践精炼而成的官方会议指南,其产生的评估结果与人类判断最为一致。相反,旨在模仿人类审稿人的指南效果较差,而严格的评分条目式评分则会降低性能。该研究强调了在自动化同行评审中,主观和整体性评分比强制执行严格的评分条目更有价值。 AI
影响 这项研究表明,基于既定的科学实践来完善大语言模型指南,可以提高自动化同行评审的准确性。
排序理由 该集群包含一篇学术论文,详细介绍了关于基于大语言模型的自动化同行评审的研究结果。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX Code Finder for Papers
- conference practice
- CORE Recommender
- DagsHub
- Gotit.pub
- Hugging Face
- Human judgments of positive and negative causal chains
- Influence Flower
- LLM
- peer review
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →