一篇新的研究论文介绍了一种新颖的衡量标准——情感诚实度商(EHQ),旨在评估大型语言模型(LLM)在多大程度上承认其知识的局限性。该研究构建了一个包含3000个问题的基准测试EHQ-3000,涵盖了虚构实体、截止日期后的事件、小众知识和条件性问题。对14个LLM API接口的分析显示,情感诚实度存在显著差异,综合EHQ得分范围从0.31到0.81不等,表明这种基于行为的衡量标准能够捕捉到标准正确性评估中不明显的差异。 AI
影响 强调了更好地评估LLM的置信度和知识边界的必要性,可能影响未来的模型开发和安全测试。
排序理由 介绍新基准和衡量标准以评估LLM行为的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Context-Conditioned Questions
- EHQ-3000
- Epistemic Honesty Quotient
- Fabricated Entity
- Hyper-Niche True
- large-language models
- Post-Cutoff Event
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →