NaturalBench
PulseAugur coverage of NaturalBench — every cluster mentioning NaturalBench across labs, papers, and developer communities, ranked by signal.
-
新研究通过最优传输和潜在去噪探索多模态对齐
两篇新研究论文探讨了改进大型模型中多模态对齐的方法。第一篇论文引入了联合核熵格罗莫夫-沃塞尔斯坦最优传输(JK-EGW),通过最小化二次最优传输目标来对齐不同模态的数据,在数据稀疏的情况下显示出改进的检索性能。第二篇论文为 LLaVA 等大型多模态模型(LMMs)提出了一种潜在去噪框架,通过在训练期间添加去噪目标来增强内部视觉表示和对分布变化的鲁棒性。
-
视觉语言模型:提示回声解决“先问后看”悖论
研究人员识别并解决了视觉语言模型(VLM)中的“先问后看”悖论,即问题置于图像之前通常会导致性能下降。该悖论的产生是因为虽然问题最初会引导模型感知到相关概念,但在过程后期,答案标记对它的关注度却很低。该解决方案被称为“提示回声”,它通过在提示的开头和结尾重复提问,确保问题既能影响感知,又能用于生成答案。这种受人类理解策略启发的、无需训练的方法显著提高了在NaturalBench和Winoground等基准测试上的性能。
-
新度量可在无标注情况下评估多模态大语言模型的逻辑一致性
研究人员引入了一种新度量 VL-LCM,可在无需真实标注的情况下评估多模态大语言模型(MLLMs)的逻辑一致性。该度量使用 MMMU 和 NaturalBench 等现有基准,评估 MLLMs 在视觉-语言任务上的因果推理能力。对 11 个开源 MLLMs 的实验表明,尽管准确性有所提高,但逻辑一致性仍然是一个重大挑战,这表明 VL-LCM 可用于辅助模型选择和新任务验证。
-
新的潜在去噪方法增强了大型多模态模型中的视觉对齐
研究人员开发了一种新的潜在去噪框架,以增强大型多模态模型(LMM)中的视觉对齐。该方法通过破坏然后去噪投影的视觉令牌来引入一种视觉监督形式,迫使模型从中间层恢复干净的特征。该方法在各种基准测试中提高了视觉理解和推理能力,包括组合鲁棒性,并且在常见的图像损坏下表现出更少的性能下降,而不会增加推理开销。