研究人员推出了一款名为HiEviDR-Bench的新基准,旨在评估AI模型如何从不同来源选择、链接和综合证据来支持论点和结论。该基准通过关注证据的层级聚合,而非仅仅最终输出质量,来解决现有评估的局限性。HiEviDR-Bench包含2000个经过人类验证的问题,附带明确的证据图谱和一个五维评估框架,以精确找出推理和证据选择中的错误。 AI
影响 该基准通过突出AI在证据综合和推理方面的弱点,有望推动其在复杂研究任务能力方面的改进。
排序理由 该条目描述了一个用于评估AI在研究任务中表现的新基准,发布在arXiv上。[lever_c_demoted from research: ic=1 ai=1.0]
在 arXiv cs.IR (Information Retrieval) 阅读 →
- alphaXiv
- arXiv
- Bibliographic Explorer
- CatalyzeX Code Finder for Papers
- Connected Papers
- CORE Recommender
- DagsHub
- Gotit.pub
- HiEviDR-Bench
- Hugging Face
- Influence Flower
- Litmaps
- ScienceCast
- scite Smart Citations
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →