kinetics
PulseAugur coverage of kinetics — every cluster mentioning kinetics across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
手术技能模型:跨量规表征的可迁移性研究
一篇新的研究论文调查了基于视觉的手术技能评估模型所学习的表征在不同评分量规之间的可迁移性。研究发现,虽然在JIGSAWS数据集上训练的模型可以在LASANA数据集上取得良好性能,但反向迁移并不成功,这可能是由于标注不一致。对照实验表明,任务特定的头部(head)而非骨干网络(backbone)承担了大部分技能预测的负担,这表明需要进一步的工作来区分可迁移的技能特征和特定领域的视觉模式。
-
高斯视频Transformer通过2DGS分词推进视频表示
研究人员开发了高斯视频Transformer(GVT),一个利用前馈式二维高斯泼溅(2DGS)分词方案的创新视频表示框架。该方法通过根据信息内容动态分配渲染权重来增强空间适应性,并通过避免每视频优化来提高泛化能力。GVT还采用高斯集合划分策略来分离静态和动态内容,从而实现更紧凑的表示。在视频重建、动作识别、压缩和生成任务上的评估表明,在重建和压缩方面取得了最先进的性能,在其他领域也取得了有竞争力的结果。
-
Xray-Visual 模型通过 150 亿图像-文本对扩展视觉任务
研究人员推出 Xray-Visual,这是一种新颖的视觉模型架构,专为大规模图像和视频理解而设计。该模型在超过 150 亿个图像-文本对和 100 亿个视频-标签对(来自 Facebook 和 Instagram)的海量数据集上进行训练,并采用先进的数据策展技术,以确保语义多样性并最大限度地减少噪声。Xray-Visual 利用结合了自监督、半监督和对比学习方法的三阶段训练流程,并基于高效的 Vision Transformer 主干…