研究人员开发了一个名为“流程中心诊断基准”(Process-Centric Diagnostic Benchmark)的新基准,用于评估用于科学同行评审的 AI 系统。该基准侧重于 AI 决策过程的透明度和可靠性,而不仅仅是最终结果。使用来自 PeerRead、NLPeer ARR-22 和 OpenReview-ICLR 的数据进行的实验表明,虽然 AI 模型可以生成一致的中间评审文本,但它们的最终决定并不总是得到先前证据的充分支持。该基准旨在提供一个透明的工具来评估 AI 在同行评审中提供协助的可靠性。 AI
影响 该基准可能带来更可靠、更透明的科学同行评审 AI 工具,从而提高研究的质量控制。
排序理由 该条目是一篇学术论文,介绍了一个用于评估 AI 系统的新基准。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- CatalyzeX
- CORE Recommender
- DagsHub
- Gotit.pub
- Hugging Face
- Influence Flower
- NLPeer ARR-22
- OpenReview-ICLR
- PeerRead
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →