研究人员探索了两种分析艺术品和照片中视觉构成的方法:一种是使用以对象为中心模型和图注意力网络的受人类启发的прием,另一种是微调基础模型。当编码器被冻结时,受人类启发的прием提供了可解释性并具有竞争力。然而,当用足够的数据进行微调时,大型自监督模型可以获得更好的结果,但会牺牲可解释性和广泛的适用性。 AI
影响 这项研究强调了在视觉理解任务的AI模型中,可解释性与性能之间的权衡。
排序理由 该集群包含一篇详细介绍新研究方法的学术论文。
在 Hugging Face Daily Papers 阅读 →
- foundation model
- graph attention network
- Hugging Face
- object-centric models
- self-supervised models
- arXiv
- computer science
- Computer vision and pattern recognition
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →