RealEstate10K
PulseAugur coverage of RealEstate10K — every cluster mentioning RealEstate10K across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新的3D生成方法在几何基础模型上使用潜在空间流匹配
研究人员开发了一种在几何基础模型(如Visual Geometry Grounded Transformer (VGGT))的潜在空间内直接进行流匹配的新方法,用于生成3D场景。该方法利用VGGT学习到的3D先验知识,而无需显式的下游表示。该方法解决了在超球面乘积流形上操作的挑战,而VGGT的潜在几何需要这种操作。在RealEstate10K、ScanNet++和ETH3D等数据集上的实验表明,与现有的场景生成基线相比,该方法在外观和…
-
新基准和框架推动视频世界建模发展
研究人员推出了“ImageTime”,这是一个旨在评估图像生成模型理解和表示时间变化能力的新基准。该基准通过要求模型生成一个动作的四个有序关键状态来评估时空一致性,超越了单一图像质量指标。此外,还开发了一个名为BiWM的新框架,利用双向自回归来推进开源交互式视频世界模型,旨在提高生成质量和推理速度。另一篇论文提出了一种用于视频世界模型的“潜在空间记忆”,将场景信息直接存储在扩散潜在空间中,从而显著加快生成速度并减小内存占用。
-
EPiC框架增强视频相机控制学习
研究人员开发了EPiC,一个用于高效视频相机控制学习的新框架。EPiC通过基于第一帧可见性来掩码源视频,从而构建高度精确的锚点视频,而无需相机姿态或点云估计。该方法确保了强大的对齐并降低了训练成本,通过一个轻量级模块实现精确的3D感知相机控制,该模块可集成到现有的视频扩散模型中。EPiC在基准数据集上取得了最先进的性能,并展示了对视频到视频场景的鲁棒的零样本泛化能力。
-
$h$-control 方法增强了免训练视频相机控制
研究人员推出了一种名为“$h$-control”的新型方法,用于视频生成模型中的免训练相机控制。该方法通过在采样过程中引入块条件伪吉布斯精炼来增强现有的流匹配技术。该方法旨在改善相机轨迹遵循度和整体视觉质量之间的平衡,在 RealEstate10K 和 DAVIS 等基准测试中表现优于先前的方法。
-
Pixel-to-4D使用动态3D高斯从单张图像生成视频
研究人员开发了一个新的框架,用于从单张图像生成视频,并提供对相机运动的增强控制。该方法利用动态3D高斯表示来建模场景和采样物体运动,从而无需迭代去噪即可实现更快的视频生成。与以前的技术相比,该方法旨在提高时间一致性和几何完整性,并在多个数据集上展示了最先进的结果。