RealEstate10K
PulseAugur coverage of RealEstate10K — every cluster mentioning RealEstate10K across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
新的SPAR3S模型可从稀疏多视图图像生成3D场景
研究人员开发了SPAR3S,一种新颖的稀疏自回归模型,用于从有限的多视图图像生成完整的3D场景。该方法在紧凑的、与体素对齐的3D潜在空间中运行,仅表示已占用的体素以提高计算效率。该模型通过可微分的3D高斯溅射(differentiable 3D Gaussian Splatting)通过光度监督来学习这个稀疏潜在空间,并采用掩码自回归Transformer来预测缺失的潜在标记及其空间分布,从而能够生成具有更高新视图质量的未见区域。
-
新方法增强新视角合成的稳定性和质量 · 已追踪 2 个来源
研究人员开发了新方法来提高新视角合成的稳定性和质量,这是一种从有限的输入图像集中生成场景新视角的技朧。一种名为 CamTrol++ 的方法通过将相机运动分解为小的自回归步骤来稳定过程,以防止误差累积,这对于更长的生成范围尤其有效。另一种名为 RoGe 的方法提出了一个端到端的框架,该框架联合训练隐式场景重建和视频生成模型,允许生成过程直接塑造其几何条件,而无需显式的 3D 中间体。两种方法都在基准数据集上展示了时间一致性和几何准确性的显著改进。
-
ReconSplat模型增强了超越观测视角的3D场景重建能力
研究人员开发了ReconSplat,这是一种新颖的前馈模型,用于3D场景重建,旨在提高未观测区域的合理视图生成能力,同时保持几何一致性。该模型集成了3D高斯泼溅(3DGS)和多视图潜在扩散模型(MV-LDM)来优化外观和场景几何。ReconSplat在RealEstate10K和DL3DV-10K等基准测试中表现出色,尤其是在具有挑战性的外推场景中,能够生成连贯的新视图和准确的深度图。
-
GenRec模型分离重建和生成,用于新视角合成
研究人员推出了一种新颖的多视角流匹配模型GenRec,旨在改进生成式新视角合成。该模型明确地将重建与生成分开,解决了现有方法将单一损失用于两个过程的局限性。GenRec利用观测掩码和单目深度估计器来指导其架构,确保观测到的像素以高保真度进行重建,同时用合理的生成内容填充未观测区域。在RealEstate10K和DL3DV-10K等数据集上进行测试,GenRec在重建准确性和感知质量方面均优于先前的方法。
-
SplatGuide 使用 3D 高斯实现无姿态新视角合成 · arXiv
研究人员推出 SplatGuide,一种从无姿态图像生成照片级新视角的新方法。该方法利用 3D 高斯的几何先验,重用单个 3D 高斯泼溅 (3DGS) 场景以扮演多种角色。渲染图像提供几何条件,每个高斯源视图索引实现遮挡感知的参考选择,重建令牌提供特征级引导。SplatGuide 在多个基准测试中取得了最先进的成果,包括 RealEstate10K、DL3DV、Tanks-and-Temples 和 Mip-NeRF 360,甚至在 …
-
SubSplat 方法提升高分辨率 3D 渲染效率
研究人员开发了 SubSplat,一种用于高分辨率像素对齐高斯泼溅的新颖方法,解决了计算成本的权衡问题。SubSplat 引入了子像素高斯重参数化器 (SPGR) 来细分主高斯,从而能够从低分辨率特征中恢复结构密度。该方法通过跨多个视图聚合特征来有效捕获高频细节,从而提高渲染质量,并在 RealEstate10K 和 ACID 等数据集上实现了卓越的效率和保真度。
-
新方法使用潜在空间流匹配增强3D场景生成
研究人员开发了一种名为潜在黎曼流匹配的新方法,以改进使用几何基础模型的3D场景生成。该技术在Visual Geometry Grounded Transformer (VGGT)等模型的潜在空间内运行,能够从稀疏输入生成更合理的几何形状。通过在超球体乘积流形上定义黎曼流匹配框架,该方法尊重VGGT的潜在几何特性,在RealEstate10K、ScanNet++和ETH3D等数据集上优于现有的场景生成基线。
-
新基准和框架推动视频世界建模发展
研究人员推出了“ImageTime”,这是一个旨在评估图像生成模型理解和表示时间变化能力的新基准。该基准通过要求模型生成一个动作的四个有序关键状态来评估时空一致性,超越了单一图像质量指标。此外,还开发了一个名为BiWM的新框架,利用双向自回归来推进开源交互式视频世界模型,旨在提高生成质量和推理速度。另一篇论文提出了一种用于视频世界模型的“潜在空间记忆”,将场景信息直接存储在扩散潜在空间中,从而显著加快生成速度并减小内存占用。
-
EPiC框架增强视频相机控制学习
研究人员开发了EPiC,一个用于高效视频相机控制学习的新框架。EPiC通过基于第一帧可见性来掩码源视频,从而构建高度精确的锚点视频,而无需相机姿态或点云估计。该方法确保了强大的对齐并降低了训练成本,通过一个轻量级模块实现精确的3D感知相机控制,该模块可集成到现有的视频扩散模型中。EPiC在基准数据集上取得了最先进的性能,并展示了对视频到视频场景的鲁棒的零样本泛化能力。
-
$h$-control 方法增强了免训练视频相机控制
研究人员推出了一种名为“$h$-control”的新型方法,用于视频生成模型中的免训练相机控制。该方法通过在采样过程中引入块条件伪吉布斯精炼来增强现有的流匹配技术。该方法旨在改善相机轨迹遵循度和整体视觉质量之间的平衡,在 RealEstate10K 和 DAVIS 等基准测试中表现优于先前的方法。
-
Pixel-to-4D使用动态3D高斯从单张图像生成视频
研究人员开发了一个新的框架,用于从单张图像生成视频,并提供对相机运动的增强控制。该方法利用动态3D高斯表示来建模场景和采样物体运动,从而无需迭代去噪即可实现更快的视频生成。与以前的技术相比,该方法旨在提高时间一致性和几何完整性,并在多个数据集上展示了最先进的结果。