一篇新发表在 arXiv 上的研究评估了大型语言模型(LLMs)在检索环境科学文献书目信息方面的准确性。研究人员比较了包括 Claude、ChatGPT、Grok、DeepSeek、Perplexity 和 Gemini 在内的多个 LLM 的性能,方法是使用基于摘要和全文的提示,针对来自顶级环境科学期刊的 50 篇随机选择的文章。研究发现,基于摘要的提示通常比全文提示具有更高的准确性,准确性也因 LLM 平台、期刊以及参考文献在输出列表中的位置而异。总体而言,LLM 辅助的环境科学文献检索被发现准确性中等但存在不一致性。 AI
影响 强调了当前 LLM 在准确检索科学文献方面能力的局限性,建议依赖这些工具的研究人员应谨慎。
排序理由 评估 LLM 在特定任务上性能的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
在 arXiv cs.IR (Information Retrieval) 阅读 →
- ChatGPT
- Claude
- DeepSeek
- Energy and Environmental Science
- Environmental Science & Technology
- Gemini
- Google Scholar
- Grok
- Lancet Planetary Health
- Nature Climate Change
- Nature Sustainability
- Perplexity
- Scopus
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →