Vips
PulseAugur coverage of Vips — every cluster mentioning Vips across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新的VIPS基准测试可实现协同自动驾驶的真实评估
研究人员推出VIPS,这是一个用于车辆-基础设施(V2I)协同自动驾驶的新基准测试。VIPS采用伪仿真方法,能够对决策鲁棒性和误差传播进行可扩展且真实的评估,解决了现有开环和闭环方法的局限性。该基准测试还附带了CoS-V2X,一个协同规划框架,该框架采用稀疏表示,用于异构观测下的高效通信和决策。
-
新框架和基准推动多模态大语言模型视觉推理能力发展
研究人员正在开发新方法来增强多模态大语言模型(MLLM)的视觉推理能力。一种名为 Beacon 的方法侧重于通过智能地仅在必要时调用工具并确保工具真正扩展模型能力来改进“模式适应性”和“工具效应”。另一个框架 LanteRn 使 MLLM 能够通过将语言与紧凑的视觉表示交织在一起,直接在潜在空间中执行视觉推理。此外,正在引入 ViSTR-Bench 和 ConVBench 等新基准,以更好地评估 MLLM 在复杂时空推理和逻辑一致性方…
-
新的ViPS框架为多模态大语言模型协调多样化视觉先验
研究人员推出ViPS,一个新颖的多模态大语言模型(MLLMs)框架,旨在通过整合多样化的视觉先验来增强空间理解。ViPS框架利用高效先验代理(Efficient Prior Proxy)以最小的开销生成基础先验,并采用动态先验融合(Dynamic Prior Fusion)机制进行上下文感知集成。实验表明,通过协调这些多样化的视觉输入,ViPS在各种空间推理和3D空间理解基准测试中取得了新的最先进性能。
-
ViPS框架从视频扩散模型生成合理的3D网格关节
研究人员开发了一个名为Video-informed Pose Spaces (ViPS)的新框架,用于为3D网格生成合理的关节。ViPS利用预训练视频扩散模型的运动先验来创建姿态空间,避免了诸如解剖结构过度伸展等常见问题。这种方法允许形状多样化、逆向运动学和连贯的动画轨迹,甚至可以泛化到未见的骨骼拓扑结构。