一篇新发表在arXiv上的研究论文《校准置信度的幻象》(The Mirage of Calibrated Confidence)揭示,视觉语言模型(VLM)通常会报告其答案的高置信度,而这与其遵循的推理过程无关。研究发现,口头置信度在很大程度上独立于模型的内部轨迹,这意味着它不能准确反映其步骤的正确性。为解决此问题,研究人员提出了一种名为轨迹基础评分(Trajectory-Grounding Score, TGS)的新评估指标,以及一个名为TGS-Bench的基准测试套件,旨在通过比较模型在有无访问其推理路径时的置信度水平,来更好地评估VLM的可靠性。 AI
影响 强调了VLM评估中的一个关键缺陷,可能导致更可靠的模型和对其局限性的更好理解。
排序理由 发表在arXiv上的研究论文,提出了一种新的视觉语言模型评估指标。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- AUROC
- CatalyzeX
- DagsHub
- ECE
- Gotit.pub
- Hugging Face
- ScienceCast
- TGS-Bench
- vision-language model
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →