PulseAugur
实时 04:50:44
实体 TempCompass

TempCompass

PulseAugur coverage of TempCompass — every cluster mentioning TempCompass across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 4
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 4 条
  1. TOOL · CL_193875 ·

    新的维纳滤波技术可减少视觉语言模型中的幻觉

    研究人员开发了一种名为维纳表示滤波(Wiener Representation Filtering)的新颖技术,以减少视觉语言模型(VLMs)中的幻觉。这种无需训练的方法在事后通过编辑语言主干的表示空间来运行。通过将隐藏状态建模为真实和幻觉成分的组合,该技术推导出一个维纳型估计器,可以减弱与幻觉相关的模式。该方法应用于 LLaVA-1.5、MiniGPT-4、Gemma3 和 mPLUG-Owl2 等模型,在 CHAIR、POPE 和…

  2. TOOL · CL_158774 ·

    ChronoStitch 方法在无需重新训练的情况下改进了长视频时序推理

    研究人员开发了 ChronoStitch,这是一种新颖的、无需训练的方法,旨在改进长时序视频中的时序推理。该技术解决了组合视频片段中独立缓存的视觉键值(KV)记忆的挑战,这些记忆通常会遭受时间相位冲突和全局顺序丢失。ChronoStitch 将存储的键重新定位到全局多模态坐标系中,并选择性地重新计算一小部分 token 来弥合内容差距。在 Qwen2.5-VL-3B 和 TempCompass 上进行测试,ChronoStitch 证…

  3. TOOL · CL_128730 ·

    新的DELTAVID框架提升视频大语言模型的细粒度感知能力

    研究人员推出了一种新颖的DELTAVID框架,旨在提升视频多模态大语言模型(Video MLLMs)的细粒度时空感知能力。该方法将识别相似视频之间差异的任务转化为可训练信号,使模型能够精确识别局部变化、时间边界和空间证据。该框架得到了DELTAVID-10K和DELTAVID-Bench数据集的支持,这些数据集旨在促进这些感知技能的可扩展训练和可靠评估。实验表明,DELTAVID显著提升了跨视频差异理解的性能,并将这种改进的局部证据推…

  4. TOOL · CL_15615 ·

    VideoThinker框架通过因果去偏提升轻量级MLLM的视频推理能力

    研究人员开发了VideoThinker,一个旨在增强轻量级多模态语言模型(MLLM)在视频分析中推理能力的新型框架。该方法解决了感知偏差问题,即模型倾向于依赖肤浅的数据模式而非真正的理解。VideoThinker采用两阶段去偏过程,首先创建一个“偏差模型”来捕捉捷径行为,然后使用因果去偏策略优化(CDPO)算法引导主模型进行准确推理。