研究人员推出了一种名为逻辑图不确定性(LGU)的新型框架,旨在改进大型语言模型(LLM)量化其不确定性的方式。与现有的侧重于语义等价性的方法不同,LGU显式地模拟了不同生成答案之间的逻辑关系,例如蕴含和不相容。这种方法旨在减少当响应在逻辑上一致但形式不同时,不确定性的高估和幻觉的错误标记。在对几个问答基准的评估中,LGU在不确定性估计方面表现出色,在AUROC和AUARC方面分别优于语义熵基线高达7.1%和3.5%。 AI
影响 通过更好地识别不确定或可能不正确的输出来提高LLM的可靠性,这对于安全关键型应用至关重要。
排序理由 介绍LLM不确定性量化新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- AUARC
- AUROC
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- Large Language Models
- Logical Graph Uncertainty
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →