对四种开源大语言模型——Phi-4 Mini、Mistral 7B Instruct v0.3、Qwen2.5-7B-Instruct 和 Llama-3.1–8B-Instruct 的最新分析显示,幻觉基准可能具有误导性。研究发现,超过一半的初始幻觉标签不正确,纠正这些标签后,模型的性能排名发生了显著变化。一个关键发现是,通过简单地拒绝回答就可以实现较低的幻觉率,因此在衡量模型可靠性时,必须将回答率与幻觉率一起考虑。 AI
影响 强调了需要更稳健的LLM评估方法,影响了开发人员和研究人员评估模型可靠性的方式。
排序理由 该条目是一篇分析LLM在基准测试中表现的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- DeBERTa-large-MNLI
- HotpotQA
- Mistral 7B Instruct v0.3
- Phi-4 Mini
- Qwen2.5-7B-Instruct
- Towards AI
- TruthfulQA
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →