一篇新发表在 arXiv 上的研究评估了八种大型语言模型 (LLM) 在软件工程系统性文献综述中筛选科学论文的表现。研究发现,尽管较新的 LLM 相较于旧模型在表现上有所边际改善,但差异并不显著。LLM 在此任务上仍难以取代人工审稿人,模型之间的一致性很高,但在具体的纳入和排除标准上存在显著分歧。优化这些标准仅带来了适度改进,表明未来研究应侧重于基于代理的方法和提示工程。 AI
影响 LLM 在自动化系统性文献综述筛选方面进展有限,表明人工监督仍然至关重要。
排序理由 评估 LLM 在特定任务上表现的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX Code Finder for Papers
- Connected Papers
- CORE Recommender
- DagsHub
- Gotit.pub
- Hugging Face
- Influence Flower
- Litmaps
- ScienceCast
- scite Smart Citations
- SESR-Eval
- SESR-Eval-Mini
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →