SE(3)-Transformers: 3D Roto-Translation Equivariant Attention Networks
PulseAugur coverage of SE(3)-Transformers: 3D Roto-Translation Equivariant Attention Networks — every cluster mentioning SE(3)-Transformers: 3D Roto-Translation Equivariant Attention Networks across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
更简单的风模型提高了四旋翼飞行控制的鲁棒性
研究人员调查了风场保真度对使用Proximal Policy Optimization (PPO) 训练的四旋翼飞行控制策略鲁棒性的影响。该研究比较了从无风条件到复杂大涡模拟场的五种扰动级别,发现一种更简单的训练方法——离散阵风域随机化——在各种风速下表现最佳。研究结果表明,控制能力而非风的真实性是限制鲁棒性的主要因素,这表明在风场保真度方面的投入应与平台对风的敏感度保持一致。
-
新框架AssemState提升MLLM在家具组装方面的空间推理能力
研究人员开发了AssemState,一个新颖的零样本框架,旨在提高多模态大语言模型(MLLMs)在家具组装等任务中进行3D空间推理的能力。该框架将组装手册分解为单个部件操作,并使用迭代反馈来优化6D姿态更新,通过模拟验证物理可行性。虽然AssemState与先前方法相比显著提高了组装树恢复和部件级操作的准确性,但它也凸显了MLLMs在精确空间关系推理方面持续存在的局限性。
-
MoSE3模型从RGB视频预测密集SE(3)运动
研究人员推出MoSE3,这是一种新颖的前馈模型,能够从单目RGB视频中预测密集的SE(3)运动。该模型在世界空间中的每个像素生成完整的6-DoF刚体变换,从而提供对场景运动更全面的理解,包括旋转、平移和物体分组。MoSE3通过学习3D点轨迹和刚度嵌入的中间表示来解决直接SE(3)预测的挑战,从而实现端到端训练和监督。为此,创建了一个名为Art-Kubric的新合成数据集,其中包含关节物体的密集SE(3)和刚度标签。
-
新型OrbFlow模型推动量子化学电子密度预测
研究人员开发了OrbFlow,这是一种新的SE(3)-等变生成模型,旨在更高效、更准确地预测电子密度。该模型利用流匹配来预测高斯型轨道系数,克服了先前基于网格和基于基组方法的局限性。OrbFlow在QM9数据集上展示了最先进的准确性,并显著降低了MD基准测试的误差,同时还减少了自洽场迭代次数并改善了分子性质的恢复。
-
World Motion Models 提供统一的 SE(3) 轨迹建模,用于 3D 动力学
研究人员推出了一种新颖的框架——World Motion Models (WMMs),用于通过将动态 3D 环境表示为稀疏 SE(3) 位姿轨迹来对其进行建模。该方法将各种场景元素(包括铰接对象、人体和相机运动)统一到一个单一的表示空间中。WMMs 利用具有每令牌噪声级别的流匹配进行序列建模,并支持跨实体和时间步的灵活条件设置,从而实现未来预测、运动填充和策略学习等多样化应用。在六个不同的 3D 视觉和机器人任务上的实验证明了该模型的…
-
CLoSeR 方法通过减少漂移提高三维重建精度
研究人员开发了 CLoSeR,一种新颖的长上下文流式三维重建方法,可显著减少跟踪漂移。通过采用闭环检测并在 SE(3) 流形上优化姿态,CLoSeR 在公里级序列上实现了无漂移重建。该方法在生成一致几何体方面优于现有的最先进方法。
-
EyeRobot 2.0 使用主动注视实现精确机器人操控,无需腕部摄像头
研究人员开发了 EyeRobot 2.0,一个利用主动注视实现精确机器人操控的新框架,无需腕部摄像头。该系统通过中央凹处理和协调的注视控制,将计算资源集中在与任务相关的特征上,模仿人类视觉。EyeRobot 2.0 在操控成功率方面表现出显著提高,尤其是在腕部摄像头会被遮挡的情况下,其性能优于传统的被动立体视觉和头部加腕部摄像头策略。
-
人工智能推动手语翻译和视频生成
研究人员正在探索用于手语翻译和生成的高级人工智能技术。一项研究调查了不同 T5 模型规模和运动特征对印度手语翻译成文本的影响,在一项共享任务中获得第五名。另一项名为 SignMimic 的项目通过分离刚性运动、非刚性变形和完成来专注于生成高质量的手语视频,并在多个数据集上展示了最先进的结果。
-
神经算子学习 Kohn-Sham 映射以加速 DFT 计算
研究人员开发了一种新颖的密度泛函理论 (DFT) 方法,通过使用神经算子学习 Kohn-Sham 映射,从而绕过了计算密集型的轨道对角化步骤。该方法在大规模分子和固体数据集上进行训练,可以预测电子密度和非相互作用动能,从而实现稳定的准线性标度自洽场 (SCF) 计算。训练好的模型在泛化到分布外系统方面表现出色,并能以 Kohn-Sham DFT 的精度准确重现密度和电子光谱,从而能够在单个 GPU 上收敛包含数万个电子的系统的 SCF。
-
四旋翼无人机利用立体视觉实现无IMU状态估计
研究人员为四旋翼无人机开发了一种新颖的纯视觉状态估计系统,该系统不依赖惯性测量单元(IMU)或GPS等外部定位系统。该系统利用一对立体摄像头,通过将静止场景点视为隐式惯性参考来估计四旋翼无人机的机体坐标系姿态、速度和其他参数。它生成一个稀疏的3D点云,其中包含每个点的速度和协方差,可作为下游世界模型的输入,无需外部依赖。
-
新AI模型编码解剖学先验以改进医学预测
研究人员开发了解剖学引导的神经网络(AINN),以解决深度学习模型在解剖学预测方面的局限性,尤其是在训练数据稀缺的情况下。AINN将软解剖学先验作为损失函数的惩罚项,并将硬先验直接整合到网络架构中,从设计上避免了解剖学上不可能的预测。该方法在一个涉及导丝诱导的主动脉髂动脉变形的临床测试案例中得到验证,将血管中心线和导丝路径提升到Lie群SE(3)框架中,并将Cosserat杆导丝与解剖学锚定的血管耦合。使用Wasserstein-2最…
-
新的CVSD-Reg方法使用视觉模型进行鲁棒的激光雷达配准
研究人员开发了CVSD-Reg,一个用于鲁棒全局激光雷达配准的新框架,该框架利用了来自视觉基础模型的视觉语义先验。该方法将知识从DINOv2教师模型蒸馏到Point Transformer V3学生模型中,增强了其创建视点鲁棒描述符的能力。然后,将蒸馏后的表示形式应用于配准任务,在KITTI和nuScenes等基准测试中取得了很高的成功率。值得注意的是,CVSD-Reg在不同传感器之间表现出强大的泛化能力,并且在推理过程中无需相机输入。
-
AdvDex框架从人类演示中学习灵巧操作
研究人员开发了AdvDex,这是一个使用人类演示来教授机器人灵巧操作技能的新框架。该系统利用了一个名为OmniShare的大型数据集,其中包含人类动作的运动学和触觉测量数据。AdvDex采用了一种称为联合对齐动作空间(JAAS)的规范动作表示,以对齐不同的手部类型,并使用域对抗性学习来提高跨具身和对象的泛化能力。
-
新的基准 H2R-Bench 揭示了人类到机器人视频生成能力的局限性
研究人员推出了 H2R-Bench,这是一个旨在评估视频生成模型将人类操作视频转换为以机器人为中心的演示的能力的新基准。该基准通过利用丰富的以自我为中心的视频,解决了机器人学习数据扩展的挑战,而这些视频由于手部和机器人末端执行器的差异而难以跨不同载体进行转换。使用 H2R-Bench 对十一个最先进的视频世界模型进行的初步评估显示,它们在人类到机器人操作迁移方面的能力存在显著局限性,许多模型在载体一致性、功能交互和任务执行方面都遇到了困难。
-
新的差分位姿估计方法提高了机器人运动精度
研究人员开发了一种新颖的差分位姿估计方法,旨在提高机器人和自主系统中6-DOF运动估计的精度和鲁棒性。这种新方法直接从帧间图像位移计算平台运动,无需独立的绝对位姿估计,从而降低了对相机标定误差的敏感性。实验表明,该方法在精度、标定鲁棒性和计算效率方面均优于现有的PnP和广义PnP技术,达到了新的技术水平。
-
面向原子系统的新型多原子复合物表示法已发布
研究人员开发了一种名为多原子复合物的新型原子系统学习表示法,旨在实现物理对称性和独特性不变。该表示法在arXiv上提交的一篇论文中进行了详细介绍,通过引入区分对映异构体的分级几何映射,解决了分子和材料描述符设计中的挑战。该系统采用有界截断方法实现效率,并使用Lean 4编程语言进行机器检查,同时产生捕捉全局结构的稳定拓扑特征。
-
新的神经网络框架学习复杂的李-泊松系统动力学
研究人员开发了潜在李-泊松神经网络(LLPNNs),这是一个新颖的框架,旨在直接从可观测数据中学习和预测李-泊松系统的动力学。这些系统对于模拟各种物理现象至关重要,包括刚体和流体动力学,但通常涉及不可观测的潜在变量。LLPNNs 利用诸如哈密顿解码器、诺特定理不变性和李群更新等几何原理来保持动力学的底层结构。该方法在适度大小的数据集和神经网络架构上展示了强大的长期预测精度、噪声鲁棒性和效率。
-
新管线可从单个全景图生成无限3D世界
研究人员开发了Genie Sim PanoWorld,一种从单个全景图像生成无限室内3D世界的新颖管线。该系统绕过了每场景优化或多视图捕获的需要,解决了现有方法在度量轨迹控制和处理大范围遮挡方面的局限性。该管线采用两阶段方法,首先通过潜在视频扩散模型生成可控轨迹的全景视频,然后将该视频重建为高保真3D高斯场景。与基于几何条件的基线相比,此输出可直接用于具身AI应用,在视频生成和下游3D重建方面均表现出卓越的性能。
-
SM4RT Transformer学习用于4D重建的结构化运动几何
研究人员开发了SM4RT,这是一种新颖的基于Transformer的模型,用于从单目RGB视频进行4D重建和结构化运动感知。与将运动视为独立逐点位移的先前方法不同,SM4RT利用了物理运动的几何结构,特别是由SE(3)控制的刚体变换。该模型将场景动力学分解为一组紧凑的运动基,使其能够在一次前向传播中联合推断3D几何、世界坐标运动和场景运动学结构。这种方法确保同一物体上的点共享相同的刚体运动轨迹,从而在保持几何完整性的同时提高运动重建性能。
-
TriGlue:用于分子胶设计的受生物学启发的生成模型
研究人员推出 TriGlue,这是一种受生物机制启发的、用于设计分子胶的新型生成模型。该模型解决了分子胶设计的复杂挑战,需要同时考虑配体生成、蛋白质-蛋白质对接和三元复合物组装。TriGlue 将此过程分解为界面估计和界面条件复合物生成,利用 SE(3)-等变模块和流匹配网络来生成有效的分子和合理的三元复合物,从而可能加速新型分子胶的发现。