SMPL-X
PulseAugur coverage of SMPL-X — every cluster mentioning SMPL-X across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新的基准和模型提高了手语翻译的准确性 · 跟踪3 个来源
研究人员正在开发新的手语翻译 (SLT) 基准和模型,以提高准确性并捕捉传统指标之外的细微差别。一篇论文提出了一种基于 LLM 的 QA 协议,以更好地评估时空理解和内容保留,揭示了除一个词汇监督系统外,当前模型的表现相似。另一篇论文介绍 SignBind-LLM,一个具有专家流的模块化框架,用于连续手语、拼写和唇读,在多个数据集上取得了最先进的结果。第三篇论文提出了 M3T,一个用于手语生成系统,该系统集成了面部表情和头部运动等非手…
-
AniCrafter模型可在动态背景中实现逼真的人物动画
研究人员开发了AniCrafter,这是一种新颖的、基于扩散的人类中心动画模型。该模型旨在遵循指定的人类运动序列,在动态的、开放域的背景中为角色制作动画。AniCrafter 利用“化身-背景”条件机制,将动画视为一个恢复问题,以实现超越现有最先进方法的通用且能感知遮挡的结果。
-
新的GRAPE方法增强了3D肖像网格估计
研究人员开发了GRAPE,一种用于关节肖像网格估计的新方法,解决了现有3D可变形模型的局限性。GRAPE引入了一个具有显式躯干到头部运动链的肖像参数模型和一个渐进式解剖对齐网络。这种方法提高了网格恢复质量、姿态对齐以及下颌关节运动与面部表情的分离度,有利于音频驱动的说话头生成等下游任务。
-
FlexiAvatar 框架通过优化可见身体区域来生成 3D 人体头像
研究人员推出 FlexiAvatar,一种从单目视频生成可动画化 3D 人体头像的新颖框架。该方法独特地仅优化可见身体区域,从而防止了由未观察到的肢体引起的伪影。FlexiAvatar 将抗遮挡的身体模型跟踪与基于扩散的纹理生成相结合,用于不可见区域,在各种数据集上实现了约 3% 的平均 PSNR 改进。在部分可见的情况下,该方法还提供了更低的运行时和内存开销。
-
新框架改进了人形机器人上的手语动作执行
研究人员开发了一个新框架,以改进人形机器人上手语生成(SLG)动作的执行。该系统解决了生成的三维身体表示中的自相交和碰撞问题,这些问题可能导致机器人运动不可行。它包含一个用于SMPL-X模型的碰撞缓解模块和一个长文本引导重定向算法,该算法使用长文本模型来识别和纠正特定于具身化的故障。
-
新的T3HG-Editor支持文本驱动的3D人体服装编辑
研究人员推出T3HG-Editor,一种新颖的文本驱动3D人体服装编辑系统。该方法解决了现有3D高斯编辑方法的局限性,这些方法在应用于服装时常常产生低保真度和不一致的结果。T3HG-Editor利用SMPL-X模型嵌入的几何和联合先验,通过三个阶段实现高保真度和服装一致性编辑:获取可编辑高斯、执行服装一致性编辑以及通过溢出修剪更新高斯。
-
Human4K数据集通过4K多视角动作捕捉数据推动三维人体重建 · 跟踪到2个来源
研究人员推出了Human4K,一个旨在改进三维人体重建的新大规模数据集。该数据集包含超过六百万张从八视角相机系统捕获的4K图像,并与专业动作捕捉数据同步。Human4K旨在通过提供高分辨率图像和精确的复杂全身运动标注来解决现有数据集的局限性,包括深度模糊和自遮挡等挑战性场景。使用Human4K训练模型已显示出在人体几何重建方面的显著改进,尤其是在手和脚等四肢方面。
-
TryOnCrafter框架实现可控相机视频虚拟试穿 · 跟踪3个来源
研究人员推出了一种新颖的、可控相机的视频虚拟试穿框架 TryOnCrafter。该系统通过将人类主体与其环境分离,使用可渲染的 4D 代理,超越了现有方法,实现了任意相机移动和视点探索。该框架利用由 4D 代理锚定的 Diffusion Transformer (DiT) 模型,生成具有精确结构同步和合理变形的逼真视频,开辟了“子弹时间”效果和 360 度观看等应用。
-
VolHuMe 数据集发布,包含高分辨率 4D 人体扫描
研究人员发布了 VolHuMe,一个新数据集,其中包含使用 64 个 RGB 和 32 个深度摄像头捕获的高分辨率 4D 人体扫描。该数据集包含 104 个受试者的详细地面真实数据,例如 SMPL-X 模型、高分辨率网格和服装分割。VolHuMe 的近距离、高分辨率捕获方法旨在保留细粒度身体部位细节,与先前的数据集相比,提高了几何保真度和纹理分辨率。研究人员还使用 VolHuMe 对当前的 3D 和 4D 人体重建方法进行了基准测试,…
-
PhysDrift框架为人形机器人生成物理上可执行的共语运动
研究人员开发了PhysDrift,一个旨在为人形机器人生成既富有表现力又物理上可执行的共语运动的新框架。该系统通过直接从语音预测机器人原生的关节轨迹,绕过中间人体表示,来解决“具身鸿沟”。这种方法旨在提高人形机器人的语音-运动对齐、物理合理性和实时交互能力。
-
新系统InHabit生成大规模3D人景交互数据
研究人员开发了InHabit,一个用于生成大规模、照片级逼真的人类与环境交互的3D数据集的新颖系统。该系统利用图像基础模型来提出动作并将人类插入3D场景,然后将这些插入细化为物理上合理的SMPL-X身体。由此产生的数据集InHabitants包含约800个场景中的78,000个样本,并在3D人类场景重建和接触估计任务中展示了改进。
-
DanceHMR 从视频中恢复详细的人体和手部运动
研究人员开发了 DanceHMR,一个用于从单摄像头视频中恢复详细人体和手部运动的新框架。该方法旨在通过在单一时间架构中统一身体和手部运动来改进现有技术,从而获得更稳定、更准确的结果。DanceHMR 在野外视频中尤其有效,并展示了增强的手部重建能力,同时保持了具有竞争力的身体精度。
-
Tamaththul3D 从视频生成高保真3D沙特手语虚拟形象
研究人员开发了Tamaththul3D,这是一个用于生成高保真3D沙特手语(SSL)虚拟形象的新型流程。该系统填补了阿拉伯手语(ArSL)资源方面的重大空白,ArSL约有4亿使用者。该项目还为Ishara-500 SSL数据集引入了首批高质量3D参数化标注,包含500个不同手语的精确SMPL-X参数。Tamaththul3D集成了SMPLer-X、WiLoR和MediaPipe等多种工具,以在ArSL的手部和身体姿态重建方面达到最先进的精度。
-
ETCH-X 和 OmniFit 通过新方法推进带衣三维人体拟合
研究人员开发了 ETCH-X,一种将参数化人体模型拟合到带衣人体三维扫描的先进方法。这种新方法通过引入“贴合度感知”拟合范式来处理服装动力学,并利用 SMPL-X 扩展表达性,从而改进了其前身。ETCH-X 利用隐式密集对应而非显式标记来实现更高的鲁棒性和精细的细节,在各种数据集上取得了显著的性能提升。