研究人员开发了一种方法来检测大型语言模型(LLM)何时在回答它们无法真正回答的问题,或在对话中过早回应。他们创建了一个新的基准和评估工具,以在六个数据集和六个开源LLM上测试此能力。研究结果表明,无法回答问题的信号在相似数据集之间转移良好,例如涉及数学问题或文本段落中信息缺失的情况,但在转移到其他类型的无法回答问题(如认识论上的“已知未知”)时效果不佳。虽然经过校准的探测器可以在不进行模型微调的情况下准确识别欠指定的回合,但其在最终任务上的成功有限,这表明剩余的差距在于模型如何利用澄清而不是检测。 AI
影响 这项研究可能有助于开发出更可靠地识别和拒绝回答无法回答问题的LLM,从而改进对话系统和信息检索。
排序理由 该集群包含一篇详细介绍LLM能力评估新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- large language models
- Musique
- ScienceCast
- SQuAD2.0
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →