研究人员推出了一种新方法DICA,通过解决注意力漂移和视觉证据利用不足等问题,来提高多模态大语言模型的可靠性。DICA在推理过程中跟踪两个信息论指标:视觉注意力熵(VAE)和输出图像相关性(OIC)。当这些指标发出潜在故障模式的信号时,DICA会应用有针对性的对比学习来增强视觉基础。实验表明,DICA显著减少了幻觉,并在各种基准测试中优于现有方法。 AI
影响 这项研究通过减少幻觉和改善视觉基础,有望带来更可靠、更值得信赖的多模态人工智能系统。
排序理由 该集群包含一篇详细介绍多模态大语言模型新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- multimodal large language models
- Output Image Correlation
- ScienceCast
- Visual Attention Entropy
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →