PulseAugur
中
实时 11:22:04
实体 Visual CoT

Visual CoT

PulseAugur coverage of Visual CoT — every cluster mentioning Visual CoT across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_254844 ·

    新方法识别视觉问答模型关键图像区域

    研究人员开发了一种名为“反事实搜索地面区域”(CSGR)的新方法,用于识别对视觉问答(VQA)模型至关重要的图像区域。该方法通过干预图像区域来观察模型答案如何变化,从而 pinpoint 关键视觉证据。当应用于注意力引导和视觉CoT微调等现有训练技术时,CSGR标注在标准交叉熵微调上的性能持续提升,证明了其在面向地面训练中的实用性。

  2. RESEARCH · CL_216978 ·

    新框架提升AI视频推理效率与准确性

    研究人员正在开发用于大型语言模型视频推理的先进方法,旨在提高效率和准确性。Apple的内部化视觉思维(IVT)框架训练模型在内部预测视频的未来状态,与生成中间推理图像相比,降低了推理开销。同时,其他方法侧重于从长视频中提取相关证据,例如PACE,它使用问题派生的因素和候选答案来指导证据获取。新的数据集和基准,如Very Big Video Reasoning (VBVR) Suite和VBVR-Pro,正在被引入,以促进大规模视频推理…

  3. RESEARCH · CL_206134 ·

    新的IVT框架将视频推理延迟降低5倍

    研究人员开发了内部化视觉思维(IVT),一个旨在增强多模态大型语言模型中主动视频推理的新框架。与生成中间图像的现有视觉CoT方法不同,IVT在训练期间训练模型预测未来的视觉表示。这使得模型能够在推理时直接进行推理,将延迟显著降低五倍以上,同时在各种视频推理任务上保持或提高性能。研究结果表明,显式的像素空间生成对于有效的视频推理并非必需,内部化的预测世界模型可以带来更准确、更高效的多模态推理器。