研究人员开发了一个新的框架和基准,用于评估大型语言模型(LLM)在科学同行评审中的应用。该方法侧重于错误检测,这是评审过程中一个关键但耗时的工作,而不是简单地模仿人类评审。提出的多层评审(MLR)框架在生成评审之前优先考虑对稿件的深入理解,旨在提高效率并与人类评审实践保持一致。尽管在识别错误和与人类评审分数相关性方面表现强劲,但该系统仍易受对抗性操纵的影响,凸显了对强大自动化评审工具的需求。 AI
影响 可能显著提高科学同行评审的效率和准确性,加速研究成果的传播。
排序理由 关于LLM辅助同行评审新框架和基准的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →