3D computer graphics
PulseAugur coverage of 3D computer graphics — every cluster mentioning 3D computer graphics across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
机器人代理的共进化通信从二维模拟迁移到三维模拟
一篇新的研究论文探讨了机器人代理在不同模拟环境中通信机制的可迁移性。该研究专门调查了在二维模拟器中共同进化的通信策略,在应用于更复杂的三维基于物理的模拟器时是否能保留其有效性。研究结果表明,性能随着回合时间预算的增加而提高,并且社交线索更多地起到辅助机制的作用,而不是导航指南,在二维环境中效果更明显。研究还分析了代理角色之间的不对称性以及迁移后可能导致性能差距的潜在因素。
-
CALIPER框架使用RGB-D数据进行工业零件识别
研究人员开发了CALIPER,一个新颖的框架,用于识别视觉上相似的工业零件,而无需大型、特定类别的数据集或CAD模型。这种无模型方法利用RGB-D数据结合外观匹配和度量尺寸证据。可以使用一小组RGB-D视频和标记图像添加新类别,其中3D重建提供外观支持,深度数据提供度量尺寸剖面。在推理时,YOLOv8n-seg模型定位零件,一个冻结的DINOv2骨干网络和一个经过周期性训练的嵌入头进行匹配,并在歧义决策时激活概率尺寸证据。CALIPE…
-
新的3D生成方法支持部件级控制和选择性输出
研究人员开发了Kaininja,一种将现有原生3D生成器扩展到生成部件级输出的新颖方法。这是通过一种双体积表示实现的,该表示解决了触摸部件之间接口的表示难题,而这是先前O-Voxel网格的局限性。Kaininja在保持其前身TRELLIS.2的速度和质量的同时,实现了部件级编辑、绑定和模拟,而无需依赖分割网络。此外,SAM3D-Part提供了一个由提示驱动的框架,用于从3D对象网格中选择性生成部件,允许用户仅生成他们需要的组件。
-
ECCV 2026:AI研究涵盖3D重建、城市和热成像
研究人员在欧洲计算机视觉会议(ECCV)上展示了涵盖3D重建、城市环境和热成像等主题的工作。会议定于两年后再次举行。
-
Bilibili AI大赛展现创意,八成以上为个人团队 · 追踪1个来源
Bilibili 首届AI创作开放赛圆满落幕,由“Project N.E.K.O.”凭借其AI生成的猫娘角色斩获百万巨奖。本次大赛共收到超过3万份参赛作品,其中超过60%的参赛者缺乏专业开发背景,凸显了AI在降低创作门槛方面的作用。该活动还得到了NVIDIA和vivo等行业合作伙伴的支持,并计划举办第二届比赛,以进一步促进Bilibili社区内由AI驱动的创作。
-
使用统计形状模型从两个X射线图像重建3D骨骼几何
研究人员开发了一种新颖的方法,仅用两张X射线图像即可重建3D骨骼几何,无需CT扫描或大型神经网络数据集。该方法利用从现有CT扫描中派生的统计形状模型,并采用可微分渲染将模型拟合到X射线图像的轮廓上。该技术在留一法验证中达到了0.86-1.43毫米的精度,尽管在模型覆盖范围之外的骨骼形状方面存在困难。
-
机器人平台利用主动传感技术进行详细的植物胁迫分析
研究人员开发了一个自主机器人平台,该平台集成了主动生理传感(特别是叶绿素荧光)与3D植物重建和几何分析。该系统利用运动规划精确地定位和测量候选叶片表面,从而实现超越被动成像的自动化、可重复且空间分辨的生理测量。该平台结合了感知、几何推理和操作能力,为农业检测和植物感知操作提供了一种机器人驱动的高分辨率植物表型分析方法。
-
Stream3Dv2框架通过几何语义融合增强零样本3D场景理解
研究人员开发了Stream3Dv2,一个用于鲁棒、零样本3D场景理解的新型框架,采用流式RGB-D输入。这种无需训练的方法通过采用嵌套的局部到历史架构和几何语义融合机制,解决了处理序列数据和2D分割掩码中的噪声的局限性。Stream3Dv2将3D分割表述为点集合并问题,并使用基于流形距离的细化来改善边界描绘。实验表明,它在流式3D分割和检测方面优于现有方法,并且可以与基于LLM的代理集成,以实现更高级的语言驱动3D场景理解。
-
创客工具市场有望增长,面临现金流和技术挑战 · 跟踪到1个来源
创客工具市场,包括3D打印机、激光雕刻机、CNC机床和UV打印机,正经历显著增长,预计到2033年全球市场规模将达到362亿美元。TwoTrees和Xtool等领先公司正在推动创新,其中TwoTrees的U1众筹额超过1000万美元,Xtool则主导了激光雕刻机市场。然而,该行业面临挑战,包括高昂的零部件成本、复杂的用户界面以及由于多SKU生产、全球物流和快速产品迭代而产生的巨额现金流需求。公司正在寻求跨境支付、供应链融资和高效全球运…
-
StateFlow 框架支持迭代式 3D 预可视化 · 跟踪到 2 个来源
StateFlow 是一个新框架,旨在增强电影、游戏和建筑等创意行业的预可视化。它引入了一个持久的、可编辑的 3D 世界状态,允许对场景、摄像机和动作进行迭代式改进,超越了一次性生成方法的局限性。该框架包含三个阶段:状态构建,用于从 2D 内容构建连贯的 3D 世界;状态演进,用于在保留记忆的同时将用户意图转化为过渡;以及状态访问,用于使用渲染反馈来改进摄像机规划。实验表明 StateFlow 在为视频创作和原型制作生成高质量 3D …
-
3D AI芯片:架构多样,目标统一,提升性能
人工智能芯片市场对3D堆叠技术的需求激增,这源于AI代理对更大内存容量、更高带宽和更高数据效率日益增长的需求。尽管各公司采用了不同的“3D堆叠”方法,但这些解决方案解决了不同的问题,并面临不同的验证标准。一些公司专注于重新聚合逻辑芯片和扩展内存,类似于海外的做法;而另一些公司,特别是国内的中国公司,则专注于逻辑和内存单元的垂直集成。这种战略分歧部分是由于制造限制以及在架构和封装层面进行创新的愿望,以弥补先进工艺节点和高带宽内存的不足。…
-
AI基础设施迎来B300价格飙升、新芯片架构及高管离职潮
AI基础设施市场正经历重大转变,以NVIDIA B300为代表的关键组件价格飙升,六个月内价值翻了三倍。这种稀缺性引发了对信息安全的担忧,因为一些卖家可能试图从买家那里提取敏感数据。与此同时,国内AI芯片公司正在探索新的推理架构,一些专注于专用的P卡,另一些则专注于异构解决方案。由于安全、性能和账户风险,大型科技公司越来越多地绕过AI模型访问的中介服务,倾向于直接集成。新兴的3D芯片领域吸引了大量投资,但大规模生产仍然是一个关键障碍。…
-
新的SceneActBench基准评估VLM智能体在3D交互方面的能力
研究人员推出了SceneActBench,一个旨在评估视觉语言模型(VLM)智能体在与3D环境交互和操作方面能力的新基准。与之前侧重于文本描述或单对象操作的基准不同,SceneActBench在一个统一的智能体-环境循环中,评估了智能体在五个不同3D任务中的表现。该基准使用PNG图像或视频帧,以及3D资产,来测试智能体在复杂、多对象3D场景中执行操作的能力。对十一种不同VLM配置的初步评估显示,性能范围在38.6-50.2之间,表明当…
-
AlayaWorld 以 720p 生成能力推动交互式视频世界建模
研究人员推出了 AlayaWorld,这是一个交互式视频世界模型,能够以 540p 和 720p 的分辨率生成 24 fps 的视频。该模型使用了一个 15B 的视频扩散 Transformer,并结合了多种机制来在长时域内保持时空一致性和稳定性,包括压缩时域历史和几何对齐的空间记忆。AlayaWorld 还采用了一种离散自回归蒸馏方法来显著缩短推理时间。另外,一篇关于 WorldPack 的论文提出了一种用于长上下文视频世界建模的动…
-
新的GFrame框架利用三维几何改进图像篡改检测 · 跟踪2个来源
研究人员开发了一个名为GFrame的新框架,通过整合三维几何线索来改进图像篡改定位。传统方法依赖二维取证证据,当篡改区域无缝融合时,其有效性会降低。GFrame通过使用单目重建来提取深度和表面法线来解决这个问题,但关键在于它在利用重建的几何信息之前会估计其可靠性。这种方法将可靠的几何信息与RGB特征融合,提高了细粒度定位的准确性,并在预算限制下优于现有方法。
-
新的 Traj-VLN 方法训练视觉语言模型在像素空间中进行导航
研究人员开发了 Traj-VLN,一种用于连续环境视觉语言导航(VLN-CE)的新方法。该方法侧重于训练视觉语言模型(VLM)直接在二维像素空间中生成导航轨迹,从而绕过了 VLM 通常缺乏的显式三维几何信息。该模型预测一系列像素坐标,以根据语言指令和历史观察指导具身智能体穿越未知环境。实验表明,这种像素空间轨迹监督显著提高了 VLN 的性能,在资源利用效率高的情况下取得了最先进的成果。
-
新的强化学习框架提高了脑机接口在三维运动解码方面的准确性
研究人员开发了一种新颖的两阶段框架,以提高脑机接口(BCI)在连续三维运动意图解码方面的准确性。该方法结合了用于初始轨迹预测的CNN-LSTM模型和一个用于离线校正残余误差的强化学习(RL)代理。CNN-LSTM--RL系统在二维环境中显示出显著的改进,平均相关系数从0.5076提高到0.7181,并将二维和虚拟现实环境中的均方根误差降低了40%以上。
-
新的3D树木重建方法使用低成本无人机
研究人员开发了一种使用低成本无人机(UAV)和CraneCam系统对落叶树进行3D重建的方法。该技术旨在监测枝条伸长,这是受气候变化影响的树木生长的一个关键方面,但历史上难以测量。该研究使用消费级无人机实现了5-6毫米的3D点精度,并报告了92%至98%的重建完整性。该论文还介绍了一个3D打印的地面实况分支,用于评估细枝条等精细细节的重建。
-
RayRoPE 引入用于多视图 3D 注意力的投影位置编码
研究人员开发了 RayRoPE,这是一种专为 3D 计算机图形学中的多视图 Transformer 设计的新型位置编码方法。这种新方法独特地编码图像块,实现 SE(3) 不变注意力,并通过预测 token 深度来适应底层 3D 场景几何。RayRoPE 在新视图合成和立体深度估计等任务中展现出了一致的改进,在 RE10K 数据集上 LPIPS 相对提高了 24%。
-
新型无网格损失将神经表示拟合速度提高了 250 倍
研究人员为隐式神经表示开发了一种新颖的无网格辅助损失函数,利用源自 Minkowski 函数的过零密度。该方法提供了显著的速度提升,比传统的持久同调损失快约 250 倍。虽然在二维中能有效修复拓扑和保持保真度,但该技术在三维中面临挑战,在三维中,梯度下降可能会掩盖低于采样密度的拓扑噪声,从而影响准确性。