研究人员提出了一种名为历史回测的新方法,用于评估生成科学研究问题的系统。该协议包括在特定历史时间点冻结从语料库生成的问题,然后评估这些问题是否在后续、时间上隔离的语料库中得到回答、解决或被忽略。一项使用天文学数据的试点研究发现,证据结构优先生成方法优于仅使用LLM提示的方法,并且人类标注者在问题结果上的一致性较低,这表明LLM裁判可能高估了它们的可靠性。 AI
影响 为生成科学问题的AI系统引入了一种新颖的、可证伪的评估方法,有可能提高研究的可复现性。
排序理由 该集群包含一篇详细介绍AI系统评估新协议的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- astronomy
- CatalyzeX
- Connected Papers
- DagsHub
- Gotit.pub
- Hugging Face
- Litmaps
- LLM-as-a-Judge
- ScienceCast
- scite Smart Citations
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →