研究人员推出了 ArcticQA,一个包含 194 个关于北极科学的多项选择题的新数据集,旨在评估大型语言模型(LLM)的弃答能力。同时,他们开发了 ArcticAbstain,一个专门测试模型在未提供正确答案或正确答案被干扰项替换时弃答能力的基准测试。测试了来自 Gemini、Claude 和 ChatGPT 系列的八个模型,结果显示它们在弃答率和对答案可用性的响应方面存在显著差异。 AI
影响 强调了大型语言模型在信息不可用时准确弃答的必要性,这是可靠科学推理的关键能力。
排序理由 该集群描述了一篇介绍用于评估大型语言模型能力的数据集和基准测试的新学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- ArcticAbstain
- ArcticQA
- arXiv
- CatalyzeX
- ChatGPT
- Claude
- DagsHub
- Gemini
- Gotit.pub
- Hugging Face
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →