3D computer graphics
PulseAugur coverage of 3D computer graphics — every cluster mentioning 3D computer graphics across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
Stream3Dv2框架通过几何语义融合增强零样本3D场景理解
研究人员开发了Stream3Dv2,一个用于鲁棒、零样本3D场景理解的新型框架,采用流式RGB-D输入。这种无需训练的方法通过采用嵌套的局部到历史架构和几何语义融合机制,解决了处理序列数据和2D分割掩码中的噪声的局限性。Stream3Dv2将3D分割表述为点集合并问题,并使用基于流形距离的细化来改善边界描绘。实验表明,它在流式3D分割和检测方面优于现有方法,并且可以与基于LLM的代理集成,以实现更高级的语言驱动3D场景理解。
-
创客工具市场有望增长,面临现金流和技术挑战 · 跟踪到1个来源
创客工具市场,包括3D打印机、激光雕刻机、CNC机床和UV打印机,正经历显著增长,预计到2033年全球市场规模将达到362亿美元。TwoTrees和Xtool等领先公司正在推动创新,其中TwoTrees的U1众筹额超过1000万美元,Xtool则主导了激光雕刻机市场。然而,该行业面临挑战,包括高昂的零部件成本、复杂的用户界面以及由于多SKU生产、全球物流和快速产品迭代而产生的巨额现金流需求。公司正在寻求跨境支付、供应链融资和高效全球运…
-
StateFlow 框架支持迭代式 3D 预可视化 · 跟踪到 2 个来源
StateFlow 是一个新框架,旨在增强电影、游戏和建筑等创意行业的预可视化。它引入了一个持久的、可编辑的 3D 世界状态,允许对场景、摄像机和动作进行迭代式改进,超越了一次性生成方法的局限性。该框架包含三个阶段:状态构建,用于从 2D 内容构建连贯的 3D 世界;状态演进,用于在保留记忆的同时将用户意图转化为过渡;以及状态访问,用于使用渲染反馈来改进摄像机规划。实验表明 StateFlow 在为视频创作和原型制作生成高质量 3D …
-
3D AI芯片:架构多样,目标统一,提升性能
人工智能芯片市场对3D堆叠技术的需求激增,这源于AI代理对更大内存容量、更高带宽和更高数据效率日益增长的需求。尽管各公司采用了不同的“3D堆叠”方法,但这些解决方案解决了不同的问题,并面临不同的验证标准。一些公司专注于重新聚合逻辑芯片和扩展内存,类似于海外的做法;而另一些公司,特别是国内的中国公司,则专注于逻辑和内存单元的垂直集成。这种战略分歧部分是由于制造限制以及在架构和封装层面进行创新的愿望,以弥补先进工艺节点和高带宽内存的不足。…
-
AI基础设施迎来B300价格飙升、新芯片架构及高管离职潮
AI基础设施市场正经历重大转变,以NVIDIA B300为代表的关键组件价格飙升,六个月内价值翻了三倍。这种稀缺性引发了对信息安全的担忧,因为一些卖家可能试图从买家那里提取敏感数据。与此同时,国内AI芯片公司正在探索新的推理架构,一些专注于专用的P卡,另一些则专注于异构解决方案。由于安全、性能和账户风险,大型科技公司越来越多地绕过AI模型访问的中介服务,倾向于直接集成。新兴的3D芯片领域吸引了大量投资,但大规模生产仍然是一个关键障碍。…
-
新的SceneActBench基准评估VLM智能体在3D交互方面的能力
研究人员推出了SceneActBench,一个旨在评估视觉语言模型(VLM)智能体在与3D环境交互和操作方面能力的新基准。与之前侧重于文本描述或单对象操作的基准不同,SceneActBench在一个统一的智能体-环境循环中,评估了智能体在五个不同3D任务中的表现。该基准使用PNG图像或视频帧,以及3D资产,来测试智能体在复杂、多对象3D场景中执行操作的能力。对十一种不同VLM配置的初步评估显示,性能范围在38.6-50.2之间,表明当…
-
AlayaWorld 以 720p 生成能力推动交互式视频世界建模
研究人员推出了 AlayaWorld,这是一个交互式视频世界模型,能够以 540p 和 720p 的分辨率生成 24 fps 的视频。该模型使用了一个 15B 的视频扩散 Transformer,并结合了多种机制来在长时域内保持时空一致性和稳定性,包括压缩时域历史和几何对齐的空间记忆。AlayaWorld 还采用了一种离散自回归蒸馏方法来显著缩短推理时间。另外,一篇关于 WorldPack 的论文提出了一种用于长上下文视频世界建模的动…
-
新的GFrame框架利用三维几何改进图像篡改检测 · 跟踪2个来源
研究人员开发了一个名为GFrame的新框架,通过整合三维几何线索来改进图像篡改定位。传统方法依赖二维取证证据,当篡改区域无缝融合时,其有效性会降低。GFrame通过使用单目重建来提取深度和表面法线来解决这个问题,但关键在于它在利用重建的几何信息之前会估计其可靠性。这种方法将可靠的几何信息与RGB特征融合,提高了细粒度定位的准确性,并在预算限制下优于现有方法。
-
新的 Traj-VLN 方法训练视觉语言模型在像素空间中进行导航
研究人员开发了 Traj-VLN,一种用于连续环境视觉语言导航(VLN-CE)的新方法。该方法侧重于训练视觉语言模型(VLM)直接在二维像素空间中生成导航轨迹,从而绕过了 VLM 通常缺乏的显式三维几何信息。该模型预测一系列像素坐标,以根据语言指令和历史观察指导具身智能体穿越未知环境。实验表明,这种像素空间轨迹监督显著提高了 VLN 的性能,在资源利用效率高的情况下取得了最先进的成果。
-
新的强化学习框架提高了脑机接口在三维运动解码方面的准确性
研究人员开发了一种新颖的两阶段框架,以提高脑机接口(BCI)在连续三维运动意图解码方面的准确性。该方法结合了用于初始轨迹预测的CNN-LSTM模型和一个用于离线校正残余误差的强化学习(RL)代理。CNN-LSTM--RL系统在二维环境中显示出显著的改进,平均相关系数从0.5076提高到0.7181,并将二维和虚拟现实环境中的均方根误差降低了40%以上。
-
新的3D树木重建方法使用低成本无人机
研究人员开发了一种使用低成本无人机(UAV)和CraneCam系统对落叶树进行3D重建的方法。该技术旨在监测枝条伸长,这是受气候变化影响的树木生长的一个关键方面,但历史上难以测量。该研究使用消费级无人机实现了5-6毫米的3D点精度,并报告了92%至98%的重建完整性。该论文还介绍了一个3D打印的地面实况分支,用于评估细枝条等精细细节的重建。
-
RayRoPE 引入用于多视图 3D 注意力的投影位置编码
研究人员开发了 RayRoPE,这是一种专为 3D 计算机图形学中的多视图 Transformer 设计的新型位置编码方法。这种新方法独特地编码图像块,实现 SE(3) 不变注意力,并通过预测 token 深度来适应底层 3D 场景几何。RayRoPE 在新视图合成和立体深度估计等任务中展现出了一致的改进,在 RE10K 数据集上 LPIPS 相对提高了 24%。
-
新型无网格损失将神经表示拟合速度提高了 250 倍
研究人员为隐式神经表示开发了一种新颖的无网格辅助损失函数,利用源自 Minkowski 函数的过零密度。该方法提供了显著的速度提升,比传统的持久同调损失快约 250 倍。虽然在二维中能有效修复拓扑和保持保真度,但该技术在三维中面临挑战,在三维中,梯度下降可能会掩盖低于采样密度的拓扑噪声,从而影响准确性。
-
新的生物力学感知方法增强了无标记手部动作捕捉
研究人员开发了一种新的生物力学感知方法,用于灵巧手动作的无标记捕捉,其性能优于传统的两阶段重建技术。这种新颖的方法利用了与生物力学模型集成的端到端、基于梯度的优化方法,在处理遮挡时表现出更强的鲁棒性和生物力学合理性。该系统成功处理了所有记录的任务,而对比方法未能收敛15%的任务,突显了新流程在临床评估和运动控制研究中的有效性。
-
AI流水线利用二维投影识别颈椎骨折
研究人员开发了一种新颖的AI流水线,用于识别颈椎骨折,该流水线无需进行完整的脊椎三维分割。该系统首先使用YOLOv8检测器在CT扫描的二维投影中定位感兴趣区域。随后,DenseNet121-Unet模型从这些投影中估计脊椎掩码,然后将这些掩码融合为近似的三维掩码。这些派生的体积由CNN-Transformer集成进行分析,在较低维空间中运行,实现了与完整三维分割方法相当的性能。
-
AI工具赋能动画和漫画创作新浪潮
该集群聚焦于AI生成的动画和漫画,展示了使用AI工具创作的内容。这些内容涵盖了AI在动画和数字艺术中的各种应用,包括AI动画、AI漫画和3D计算机图形。
-
新的MARL方法通过3D重建分析增强轨道检查能力
研究人员开发了一种新的方法,使用多智能体强化学习(MARL)来控制一组检查航天器。该方法利用一个通用的奖励函数,该函数由对轨道上被检查对象的3D重建分析提供信息,使智能体能够自主决定何时收集图像。该研究为MARL检查任务和更广泛的检查领域提供了最佳实践的见解。
-
MVP-Nav框架赋能具身智能体进行仅RGB导航
研究人员推出MVP-Nav,一个新颖的框架,专为具身智能体设计,使其能够仅使用RGB摄像头输入在环境中导航。该系统解决了仅RGB感知固有的深度不确定性和语义-物理不匹配的挑战。MVP-Nav通过将2D语义实例投影到3D边界框中,从单目视图重建3D物理占用,创建全局空间语义表示。然后,它利用多层价值地图(MVM)将语义优先级与重建的几何结构相结合,实现物理基础的规划,并在零样本物体导航基准测试中取得最先进的性能。
-
Meshtryoshka:可微分渲染框架使用网格栅格化
研究人员推出了一种新颖的可微分渲染框架Meshtryoshka,该框架利用网格栅格化。这种方法结合了嵌套网格壳和三维符号距离函数,能够提取等值面并计算顶点不透明度。该方法通过梯度间接更新网格顶点位置,从而兼容标准的网格渲染器。Meshtryoshka在以物体为中心的场景中表现出竞争力,并实现了大规模、无界真实场景的高质量新视角合成,接近非网格方法的成果。
-
新的MV-SDI方法增强了从2D扩散模型生成3D内容的能力
研究人员开发了一种名为多视图聚合分数蒸馏(MV-SDI)的新方法,以改进从2D扩散模型生成3D内容。该技术通过在每个生成步骤中聚合来自多个视图的样本来解决梯度高方差问题,而不是依赖单一视图。MV-SDI保持原始2D模型冻结,无需重新训练或多视图数据,显著减少了优化步骤,并提高了CLIP R-Precision和CLIP分数等一致性和质量指标。