Assembly101
PulseAugur coverage of Assembly101 — every cluster mentioning Assembly101 across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新的SYNCR基准测试LLM的跨视频推理能力 · 跟踪到2个来源
研究人员推出SYNCR,这是一个用于评估和训练多模态大语言模型(MLLM)跨视频推理能力的新框架。SYNCR使用Habitat、Kubric和CLEVRER等模拟引擎构建,提供了一个受控环境,包含数千个跨八种不同推理任务的问题和训练示例。对当前MLLM的评估显示,它们在物理比较和场景整合方面存在显著弱点,即使是最好的模型也无法达到人类水平。然而,使用SYNCR数据进行微调已显示出显著的改进,尤其是在时间顺序方面,即使在训练期间未见过的…
-
新的自监督方法分割长建筑视频中的动作
研究人员开发了ConsensusTAS,一种用于长时域视频(尤其是在建筑环境中)的时间动作分割的新型自监督学习方法。该方法通过识别不同的活动阶段而无需标签,解决了耗时手动标注的挑战。ConsensusTAS在GTEA和Breakfast等公共数据集上表现出色,并在分割现实建筑素材中的砌砖等复杂活动方面显示了实际应用潜力。值得注意的是,该算法可以在CPU上运行,使其适用于视频监控和人机协作等资源受限的应用。
-
D-CLOT 方法改进无监督动作分割
研究人员推出了一种新颖的无监督动作分割方法 D-CLOT,该方法解决了动作原型与精炼帧几何之间的不一致性。该方法通过从精炼帧嵌入中重新估计动作原型来增强现有的最优传输技术,从而提高分割质量。D-CLOT 在五个基准测试中取得了显著的进步,包括在 YTI 数据集上 F1 分数提高了 12.7%,并在具有挑战性的 Assembly101 基准测试上建立了一个新的基线。
-
新的超图框架增强了人类活动识别能力
研究人员开发了一种新颖的动态操纵超图框架,以改进视频中的人类活动识别。该方法超越了传统的成对关系,将多实体配置建模为高阶单元,捕捉手、物体和工具之间不断演变的关系。该框架利用外观、空间、运动和语义角色特征,并通过一个在节点和超边之间传递消息的推理网络。在EPIC-KITCHENS-100/VISOR和Assembly101数据集上的评估显示,与现有方法相比,识别精度有了显著提高。
-
新的P-JEPA方法增强了AI对程序化视频的理解能力
研究人员开发了一种名为P-JEPA(程序化联合嵌入预测架构)的新方法,以改进程序化视频表示的学习。该方法通过将问题简化为密集、帧对齐的动作空间,解决了现有模型在处理具有复杂、多步骤任务的长时间视频方面的局限性。P-JEPA可以处理长达30分钟以上的视频,能够有效理解程序化步骤,并在细粒度动作分类任务上取得最先进的成果,同时使用的参数比基于大型语言模型的方法少得多,并且能够实时运行。