一项新研究探讨了在疾病传播建模领域使用大型语言模型(LLMs)进行系统性文献综述(SLRs)的用途。研究人员开发了一个LLM流程,从536篇基于代理的模型论文中提取信息,并将其性能与人工进行的SLR进行了比较。研究发现,GPT-4.1在论文级别上的准确率约为77.95%,而GPT-5.0达到了81.67%,字段级别的准确率差异很大。值得注意的是,LLMs之间的一致性被确定为输出质量的潜在指标,低一致性表明存在幻觉,而低准确率但高一致性则指向了人类数据集中的噪声。 AI
影响 LLMs有潜力在专业科学领域自动化和提高系统性文献综述等研究过程的效率。
排序理由 该集群描述了一篇学术论文,详细介绍了一种使用LLMs进行系统性文献综述的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →