PulseAugur
实时 06:54:46
English(EN) Using Human-LLM Disagreement to Improve Checklist-Based Quality Appraisal

人类-大语言模型分歧改进研究质量评估清单

研究人员探讨了如何利用人类与大语言模型(LLMs)之间的分歧来加强对研究的质量评估。通过分析基于清单的评估中的差异,特别是使用潜在轨迹研究报告指南(GRoLTS)清单,他们识别出了导致显著分歧的模糊或有条件的标准。修改这些有问题的条目提高了研究评估的准确性和相对排名,表明大语言模型辅助评估的有效性与评估清单本身的设计密切相关。 AI

影响 提出了改进AI辅助研究综合和评估工作流程可靠性的方法。

排序理由 学术论文,详细介绍了使用大语言模型分歧改进研究评估的新颖方法。 [lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

人类-大语言模型分歧改进研究质量评估清单

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Timo van der Kuil (Methodology and Statistics Utrecht University), Bruno Messina Coimbra (Methodology and Statistics Utrecht University), Mirjam van Zuiden (Clinical Psychology Utrecht University), Robert A. Bagheri (Methodology and Statistics Utrecht Un… ·

    利用人类-LLM分歧改进基于清单的质量评估

    arXiv:2608.20385v1 Announce Type: new Abstract: Systematic reviews rely on quality appraisal of included studies, a process that is time-consuming and sensitive to ambiguity in checklist criteria. Although large language models (LLMs) offer opportunities to support these tasks, a…