实体
PerceptionTest
PerceptionTest
PulseAugur coverage of PerceptionTest — every cluster mentioning PerceptionTest across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
COMET框架通过增强的运动和时序推理能力提升视频大语言模型
研究人员开发了COMET,一个旨在通过改进对细粒度运动和时序推理的理解来增强视频多模态大语言模型的新框架。该框架引入了一个专门的时序运动分支,并通过交叉注意力机制将其发现整合到外观流中。COMET还采用了一种新颖的优化策略,该策略利用时序顺序作为直接学习信号,从而在Qwen3-VL-8B和InternVL2.5-8B等不同模型架构的以动作为中心和时序推理任务上取得了显著的性能提升。
-
新的PushupBench基准测试揭示VLM在计算重复次数方面存在困难
研究人员推出了PushupBench,这是一个旨在评估视觉语言模型(VLM)在视频中准确计算重复次数能力的新数据集。该基准测试表明,即使是顶级VLM在此任务上也表现不佳,在计算俯卧撑次数方面仅达到42.1%的精确准确率。此外,研究还发现,一些模型可能利用统计偏差而非进行真正的时序推理。有趣的是,在该计数任务上对模型进行微调可以提高它们在更广泛的视频理解基准测试上的表现。