两篇研究论文探讨了提高大语言模型(LLM)生成答案可靠性的方法,特别是在问答任务中。第一篇论文介绍了 A-CRC-QA,这是一个事后校准框架,旨在通过将选择条件误差控制重新表述为线性期望约束来控制被接受答案中的错误率。第二篇论文实证研究了如何从词元概率中推导出数学问答的校准置信度估计,比较了单通道和多通道估计器,并评估了 Platt 缩放和等渗回归等事后校准方法。 AI
影响 提高了 LLM 输出的可靠性,这对于需要高准确性和可信度的应用至关重要。
排序理由 两篇在 arXiv 上发表的学术论文,提出了大语言模型不确定性量化和校准的新方法。
- arXiv
- Hugging Face
- Isotonic regression
- large language models
- Monte Carlo Dropout
- Platt scaling
- A-CRC-QA
- MedMCQA
- question answering
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →