实体
Video-understanding framework for automatic behavior recognition
Video-understanding framework for automatic behavior recognition
PulseAugur coverage of Video-understanding framework for automatic behavior recognition — every cluster mentioning Video-understanding framework for automatic behavior recognition across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
2 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
新的HAS方法通过高亮引导增强LLM视频摘要能力
研究人员开发了一种名为高亮引导注意力引导(HAS)的新方法,以提高多模态大语言模型(M-LLM)在视频摘要方面的性能。HAS通过全局考虑帧的重要性,解决了当前方法关注离散关键帧的局限性。所提出的技术首先识别连续的帧级高亮分布,然后利用该分布来引导M-LLM的注意力,确保高亮帧获得更多关注,同时不太高亮的帧也不会被完全遗忘。在各种基准测试上的评估表明,HAS在视频摘要方面取得了令人信服的结果。
-
新研究通过改进的时间一致性和效率来增强视频生成
研究人员正在开发新的方法来改进视频生成模型,重点关注效率和时间一致性。一种方法,Hamiltonian Generative Networks (HGNs),旨在实现与帧率无关的连续时间预测,并提出了解决潜在幅度增长和截断误差累积等问题的修复方案。另一个重点领域是使用扩散模型统一视频生成和理解,Gen4U 等框架将生成表示重新用于视频分类和深度估计等任务。效率也通过诸如少步蒸馏和动态计算等技术得到解决,如 Dynamic-in-Few…