一项预注册的比较评估了两种使 LLM 能够回答关于小型研究语料库的问题的方法:单轮向量 RAG 系统和 LLM 编译的 markdown 维基。两个系统都使用了相同的答案生成模型,并由两名盲评 LLM 法官对 24 篇论文中的 13 个问题进行了评分。维基在综合跨论文信息方面表现更好,但当结合两位法官的分数时,其优势并不具有统计学意义。RAG 在单事实查找方面达到了其预测,尽管一位法官会驳斥它。维基的查询成本显著更高,这与它运行成本更低的预测相反。 AI
影响 强调基于 LLM 的研究综合并非一种单一能力,系统在证据组织、引用支持、成本和评分粒度方面存在差异。
排序理由 该集群包含一篇学术论文,详细介绍了两种 LLM 辅助研究综合方法的比较。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →