研究人员提出了CapFrame,一个旨在解决在3D高斯场景中手动放置虚拟相机以获得特定视角的新框架。这项名为文本指令视角对齐(TIVG)的新任务,旨在自动识别一个符合所需场景视角文本描述的6-DoF相机位姿。CapFrame采用检索-翻译-精炼(Retrieve-Translate-Refine)流水线,利用多模态大语言模型(MLLMs)将语言指令转换为几何伪标签,以优化3D高斯泼溅(Gaussian Splatting)环境中的相机方向和布局。 AI
影响 这项研究通过自动化相机放置,可能简化3D内容的创建,对虚拟现实、游戏开发和建筑可视化产生影响。
排序理由 该集群包含一篇详细介绍计算机视觉新方法和新任务的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →