SE(3)-Transformers: 3D Roto-Translation Equivariant Attention Networks
PulseAugur coverage of SE(3)-Transformers: 3D Roto-Translation Equivariant Attention Networks — every cluster mentioning SE(3)-Transformers: 3D Roto-Translation Equivariant Attention Networks across labs, papers, and developer communities, ranked by signal.
9 天有情绪数据
-
新AI模型编码解剖学先验以改进医学预测
研究人员开发了解剖学引导的神经网络(AINN),以解决深度学习模型在解剖学预测方面的局限性,尤其是在训练数据稀缺的情况下。AINN将软解剖学先验作为损失函数的惩罚项,并将硬先验直接整合到网络架构中,从设计上避免了解剖学上不可能的预测。该方法在一个涉及导丝诱导的主动脉髂动脉变形的临床测试案例中得到验证,将血管中心线和导丝路径提升到Lie群SE(3)框架中,并将Cosserat杆导丝与解剖学锚定的血管耦合。使用Wasserstein-2最…
-
四旋翼无人机利用立体视觉实现无IMU状态估计
研究人员为四旋翼无人机开发了一种新颖的纯视觉状态估计系统,该系统不依赖惯性测量单元(IMU)或GPS等外部定位系统。该系统利用一对立体摄像头,通过将静止场景点视为隐式惯性参考来估计四旋翼无人机的机体坐标系姿态、速度和其他参数。它生成一个稀疏的3D点云,其中包含每个点的速度和协方差,可作为下游世界模型的输入,无需外部依赖。
-
新的CVSD-Reg方法使用视觉模型进行鲁棒的激光雷达配准
研究人员开发了CVSD-Reg,一个用于鲁棒全局激光雷达配准的新框架,该框架利用了来自视觉基础模型的视觉语义先验。该方法将知识从DINOv2教师模型蒸馏到Point Transformer V3学生模型中,增强了其创建视点鲁棒描述符的能力。然后,将蒸馏后的表示形式应用于配准任务,在KITTI和nuScenes等基准测试中取得了很高的成功率。值得注意的是,CVSD-Reg在不同传感器之间表现出强大的泛化能力,并且在推理过程中无需相机输入。
-
AdvDex框架从人类演示中学习灵巧操作
研究人员开发了AdvDex,这是一个使用人类演示来教授机器人灵巧操作技能的新框架。该系统利用了一个名为OmniShare的大型数据集,其中包含人类动作的运动学和触觉测量数据。AdvDex采用了一种称为联合对齐动作空间(JAAS)的规范动作表示,以对齐不同的手部类型,并使用域对抗性学习来提高跨具身和对象的泛化能力。
-
新的基准 H2R-Bench 揭示了人类到机器人视频生成能力的局限性
研究人员推出了 H2R-Bench,这是一个旨在评估视频生成模型将人类操作视频转换为以机器人为中心的演示的能力的新基准。该基准通过利用丰富的以自我为中心的视频,解决了机器人学习数据扩展的挑战,而这些视频由于手部和机器人末端执行器的差异而难以跨不同载体进行转换。使用 H2R-Bench 对十一个最先进的视频世界模型进行的初步评估显示,它们在人类到机器人操作迁移方面的能力存在显著局限性,许多模型在载体一致性、功能交互和任务执行方面都遇到了困难。
-
新的差分位姿估计方法提高了机器人运动精度
研究人员开发了一种新颖的差分位姿估计方法,旨在提高机器人和自主系统中6-DOF运动估计的精度和鲁棒性。这种新方法直接从帧间图像位移计算平台运动,无需独立的绝对位姿估计,从而降低了对相机标定误差的敏感性。实验表明,该方法在精度、标定鲁棒性和计算效率方面均优于现有的PnP和广义PnP技术,达到了新的技术水平。
-
面向原子系统的新型多原子复合物表示法已发布
研究人员开发了一种名为多原子复合物的新型原子系统学习表示法,旨在实现物理对称性和独特性不变。该表示法在arXiv上提交的一篇论文中进行了详细介绍,通过引入区分对映异构体的分级几何映射,解决了分子和材料描述符设计中的挑战。该系统采用有界截断方法实现效率,并使用Lean 4编程语言进行机器检查,同时产生捕捉全局结构的稳定拓扑特征。
-
新的神经网络框架学习复杂的李-泊松系统动力学
研究人员开发了潜在李-泊松神经网络(LLPNNs),这是一个新颖的框架,旨在直接从可观测数据中学习和预测李-泊松系统的动力学。这些系统对于模拟各种物理现象至关重要,包括刚体和流体动力学,但通常涉及不可观测的潜在变量。LLPNNs 利用诸如哈密顿解码器、诺特定理不变性和李群更新等几何原理来保持动力学的底层结构。该方法在适度大小的数据集和神经网络架构上展示了强大的长期预测精度、噪声鲁棒性和效率。
-
新管线可从单个全景图生成无限3D世界
研究人员开发了Genie Sim PanoWorld,一种从单个全景图像生成无限室内3D世界的新颖管线。该系统绕过了每场景优化或多视图捕获的需要,解决了现有方法在度量轨迹控制和处理大范围遮挡方面的局限性。该管线采用两阶段方法,首先通过潜在视频扩散模型生成可控轨迹的全景视频,然后将该视频重建为高保真3D高斯场景。与基于几何条件的基线相比,此输出可直接用于具身AI应用,在视频生成和下游3D重建方面均表现出卓越的性能。
-
SM4RT Transformer学习用于4D重建的结构化运动几何
研究人员开发了SM4RT,这是一种新颖的基于Transformer的模型,用于从单目RGB视频进行4D重建和结构化运动感知。与将运动视为独立逐点位移的先前方法不同,SM4RT利用了物理运动的几何结构,特别是由SE(3)控制的刚体变换。该模型将场景动力学分解为一组紧凑的运动基,使其能够在一次前向传播中联合推断3D几何、世界坐标运动和场景运动学结构。这种方法确保同一物体上的点共享相同的刚体运动轨迹,从而在保持几何完整性的同时提高运动重建性能。
-
TriGlue:用于分子胶设计的受生物学启发的生成模型
研究人员推出 TriGlue,这是一种受生物机制启发的、用于设计分子胶的新型生成模型。该模型解决了分子胶设计的复杂挑战,需要同时考虑配体生成、蛋白质-蛋白质对接和三元复合物组装。TriGlue 将此过程分解为界面估计和界面条件复合物生成,利用 SE(3)-等变模块和流匹配网络来生成有效的分子和合理的三元复合物,从而可能加速新型分子胶的发现。
-
新的深度学习框架OrbitAll统一了分子系统表示
研究人员开发了OrbitAll,一个新颖的深度学习框架,旨在利用量子力学原理表示所有分子系统。该框架集成了自旋极化轨道特征与SE(3)-等变图神经网络,能够对带电、开壳层和溶剂化分子进行准确预测。与现有的AI模型和密度泛函理论相比,OrbitAll在性能和泛化能力方面表现出显著的改进,以显著减少的训练数据和更快的速度实现了化学精度。
-
新的InertialAR模型通过Transformer++推进三维分子生成
研究人员开发了InertialAR,一种用于生成三维分子的新型自回归模型。该模型通过创建与标准惯性坐标系对齐的SE(3)和置换不变的token序列来解决分子token化的关键挑战。InertialAR结合了几何位置编码,为Transformer注意力注入三维几何感知能力,并采用分层自回归方法来预测原子类型和坐标。该模型在多个数据集上的无条件生成方面表现出最先进的性能,并在特定化学功能的条件生成方面表现出色。
-
DyneTrion 模拟器模拟蛋白质跨时间尺度的动力学
研究人员开发了 DyneTrion,这是一种新颖的生成式模拟器,旨在模拟蛋白质在各种时间尺度上的动力学。该系统采用三注意力架构,结合了 SE(3) 鲁棒几何更新、用于结构完整性的空间注意力和用于相关演化的时间注意力。DyneTrion 已证明其能够准确重现分子动力学模拟在柔韧性、集合分布和相互作用可观测值方面的结果,同时在推断过程中保持立体化学有效性。
-
新的SeeSE3方法揭示了视觉模型中三维空间的理解
研究人员开发了一种名为SeeSE3的新方法,以研究视觉基础模型是否固有地理解三维欧几里得空间。与专注于预测深度等三维属性的先前方法不同,SeeSE3分析了模型特征空间与欧几里得变换群之间的关系。研究发现,即使是没有经过明确三维监督训练的模型,在正确探测时也会表现出与三维空间高度相关的潜在子空间。这一发现使得直接在模型的潜在空间中进行视觉里程计和定位等任务的新型“潜在空间导航”技术成为可能。
-
GenVid2Robot框架将生成的视频运动转化为可执行的机器人轨迹
研究人员开发了GenVid2Robot框架,该框架将生成的视频运动转化为可执行的机器人操作轨迹。该系统通过确保物理可执行性、度量几何和抓取接地,解决了直接将生成视频用于机器人技术的局限性。GenVid2Robot验证视频运动与真实世界观察的几何一致性,并将其应用于机器人抓取,提高了视频引导操作的可靠性。
-
RayRoPE 引入用于多视图 3D 注意力的投影位置编码
研究人员开发了 RayRoPE,这是一种专为 3D 计算机图形学中的多视图 Transformer 设计的新型位置编码方法。这种新方法独特地编码图像块,实现 SE(3) 不变注意力,并通过预测 token 深度来适应底层 3D 场景几何。RayRoPE 在新视图合成和立体深度估计等任务中展现出了一致的改进,在 RE10K 数据集上 LPIPS 相对提高了 24%。
-
新的几何可观性指数增强了 SE(3) 位姿估计
研究人员引入了几何可观性指数(GOI),这是一个用于评估 SE(3) 环境中位姿估计敏感性的新颖指标。该指数量化了单个测量值对估计位姿的影响,并与 M 估计量和费舍尔信息建立了联系。GOI 的最小特征值直接指示弱可观性和有限样本稳定性,提供了一个已通过合成数据和 TUM RGB-D、KITTI 等真实世界数据集上的实验验证的理论框架。
-
VulcanVoxel 学习用于机器人刀片插入的 3D 意图
研究人员开发了 VulcanVoxel,这是一种机器人学习 3D 意图的新方法,特别适用于杂乱环境中的刀片插入任务。与推断 SE(3) 位姿分布的传统方法不同,VulcanVoxel 通过在 3D 占用场上使用掩码自编码器来预测刀片占用,从而在空间上进行操作。该方法在每个体素处局部重建可行性,使其能够从单峰数据中恢复多峰预测。VulcanVoxel 在没有人工标注的情况下,在 10,000 次真实仓库存放的试验中进行训练,在覆盖率方面…
-
LIME系统从自主视频中学习意图感知相机运动
研究人员开发了LIME,一个旨在从自主视频生成意图感知相机运动的新颖系统。LIME解决了基于自然语言意图预测最优相机姿态的挑战,这项任务在机器人学中之前探索不足。该系统从自主视频中挖掘多意图相机运动监督,将意图与相对SE(3)目标姿态配对。LIME结合了自回归观测增益输出和连续流匹配姿态头,以联合预测下一个视图并表示多假设目标视图,从而实现对被动录制的积极感知。