PulseAugur
中
实时 19:47:31
实体 3D foundation model

3D foundation model

PulseAugur coverage of 3D foundation model — every cluster mentioning 3D foundation model across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_196012 ·

    新基准和模型推动视频相机运动理解

    研究人员推出了 CamChoreo,这是一个用于理解视频中复杂相机运动的新基准数据集。该数据集包含 4,229 个带有详细时间标注的真实世界剪辑,其中近一半的片段包含多个同时发生的相机运动。为了解决当前多模态大语言模型 (MLLMs) 在识别这些细粒度运动方面的局限性,研究团队开发了 CamDistill。该方法将几何知识蒸馏成轻量级 token,从而在推理时无需单独的 3D 基础模型即可实现准确的相机运动识别。

  2. TOOL · CL_181136 ·

    MVHOI框架使用3D基础模型进行复杂人-物交互视频重演

    研究人员开发了MVHOI,一个新颖的两阶段框架,用于复杂的人-物交互(HOI)视频重演。该系统通过利用3D基础模型,将多视角条件桥接到复杂的HOI场景。该框架首先提取隐式运动动力学,并使用运动驱动对象先验模块从多视角参考中预测对象的方向和外观。随后,一个基于Diffusion Transformer的视频生成模型利用这些预测进行逼真的视频合成,在对象保真度和交互真实性方面优于现有方法。