两篇新研究论文探讨了概念瓶颈模型(CBMs)的可解释性,该模型旨在通过人类可理解的概念来分解预测,从而使深度学习模型更加透明。第一篇论文介绍了“Clarity”,一种诊断指标,用于评估下游性能与概念激活的语义对齐之间的权衡,发现模型可以通过偏离语义对齐来优化任务性能。第二篇论文提出了“表示完整性”作为CBMs的一个关键属性,并引入了组一致性和概念覆盖率等指标来评估支持概念的特征的组织程度,表明概念完整性是超越简单准确性的一个重要标准。 AI
影响 这些论文引入了评估和改进概念瓶颈模型可解释性的新框架,有望带来更值得信赖的AI系统。
排序理由 两篇在arXiv上发表的学术论文,介绍了评估概念瓶颈模型的新方法和指标。
- arXiv
- CatalyzeX
- Concept Bottleneck Models
- DagsHub
- Gaoxiang Huang
- Gotit.pub
- Hugging Face
- Konstantinos P. Panousis
- Representation Integrity
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →