InternVL3.5
PulseAugur coverage of InternVL3.5 — every cluster mentioning InternVL3.5 across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新基准 TRACE 应对火灾后场景中的物体理解问题
研究人员推出 TRACE,一个旨在评估火灾后环境中物体理解能力的新基准。该基准包含合成场景和真实图像序列,用于测试物体检测和预退化理解能力。现有模型在火灾损伤严重程度增加时性能显著下降,但提出的特征恢复模块 (FRM) 可通过将退化特征映射到原始对齐表示来提高性能。
-
新的MMDiff框架增强了多模态大型语言模型的可控性和可解释性
研究人员开发了MMDiff,一个旨在增强多模态大型语言模型(MLLMs)的可解释性和可控性的新框架。该系统训练多模态稀疏自编码器(SAEs)来识别和分离多模态训练期间被改变的特定特征。MMDiff通过允许用户移除或引导这些发现的特征来实现目标控制,从而提高MLLMs的性能和安全性。
-
MMDiff框架增强多模态LLM的可解释性和控制力
研究人员开发了MMDiff,一个旨在增强多模态大型语言模型(MLLMs)可解释性和控制力的新框架。该系统利用多模态稀疏自编码器来分离、检测和操纵这些模型中的特定特征。MMDiff可以区分多模态训练修改的特征,识别特定任务的因果特征,并通过移除或引导这些发现的特征方向来实现目标控制。MMDiff应用于LLaVA-MORE、PaliGemma 2和InternVL3.5等模型,在提高空间推理和OCR任务的性能方面取得了成功,同时也降低了多…
-
新的基准和模型在机器人和推理领域推进视觉-语言能力 · 跟踪了10个来源
近期研究探讨了多个领域中视觉-语言模型(VLM)的进展。DeCAL 引入了一个新的模型,用于灵巧操作,该模型集成了触觉感知和视觉-语言理解。ROBORMBENCH 强调了 VLM 奖励模型在机器人领域对释义的脆弱性,并提出了一个衡量这种不稳定的基准。KoNA 和 FPCO-Dialog 分别针对 VLM 中的选择性不合规和持续的错误前提,提出了新的基准和微调策略。MultihopSpatial 专注于提高 VLA 代理的多跳组合空间推…
-
新方法通过漂移敏感数据增强多模态大语言模型隐私
研究人员开发了Anchored Privacy Drifting (APD),一种新颖的无需训练的方法,用于增强多模态大语言模型(MLLMs)的隐私。APD通过在保留关键情境线索的同时,对隐私敏感元素进行语义修改,来解决用户输入和视觉情境可能包含敏感信息的挑战。使用AdaptShield(一个旨在评估隐私保护和情境效用的新基准)对APD的有效性进行了评估,结果显示在多个MLLM系列中均有显著改进。
-
Zamba2-VL 模型提供更快的视觉-语言处理速度
研究人员推出了一系列新的视觉-语言模型 Zamba2-VL,该模型利用了结合 Mamba2 状态空间层和 Transformer 块的混合架构。这些模型在各种视觉和语言任务上表现出色,可与 Molmo2 和 Qwen3-VL 等成熟的基于 Transformer 的模型相媲美。Zamba2-VL 的一个关键优势是其显著更快的首个 token 生成时间,这使其特别适合设备端和边缘部署。