一项发表在arXiv上的新研究分为两部分,探讨了大型语言模型(LLMs)在辅助科学研究方面的能力。第一篇论文详细介绍了2025年中期的模型如ChatGPT、Claude和DeepSeek在生成项目计划和评估提案方面的表现,发现尽管人类评审员对AI生成的提案的评价与人类撰写的提案相似,但AI评审员更偏爱AI生成的内容。第二篇论文侧重于文献综述辅助,显示2025年中期的LLMs仅选择了少量与人类专家重叠的参考文献,并且经常生成带有元数据错误的参考文献,尽管2026年的模型ChatGPT Pro 5.5表现出更高的可靠性。 AI
影响 LLMs在项目规划和文献综述等科学研究任务中显示出辅助潜力,但由于存在偏见和潜在错误,需要仔细验证。
排序理由 该集群包含两篇发表在arXiv上的学术论文,详细介绍了对AI能力的研究。
- arXiv
- ChatGPT
- ChatGPT 4o
- ChatGPT Pro 5.5
- Claude
- Claude Opus-4.8
- DeepSeek
- Gemini
- OpenAI Deep Research
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →