研究人员开发了SkillMoV,一个用于从多视角视频估计人类熟练度的新颖框架。该参数高效系统利用了混合视角投影仪(MoVP),该投影仪将混合专家范式应用于不同的摄像机视角。SkillMoV结合了软路由、跨视角注意力、原型锚定和门控投影来生成技能嵌入。在EgoExo4D数据集上进行评估时,SkillMoV在Exos设置中实现了50.17%的总体准确率,以单一、联合训练的模型,比现有方法提高了3.57个百分点。 AI
影响 通过改进多视角视频分析,增强了各领域自动化技能评估。
排序理由 该集群包含一篇详细介绍新框架及其在数据集上评估的研究论文。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →