PulseAugur
中
实时 12:43:27
实体 Chain-of-Visual-Thought

Chain-of-Visual-Thought

PulseAugur coverage of Chain-of-Visual-Thought — every cluster mentioning Chain-of-Visual-Thought across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_252254 ·

    新的PhysPlan框架增强了AI视频生成中的物理真实感

    研究人员开发了PhysPlan,一个旨在提高扩散模型生成视频的物理真实感的新框架。与以往经常产生物理上不合理的序列的方法不同,PhysPlan使用视觉语言模型(VLM)来模拟主体物理,将多模态输入分解为一系列视觉思维。这种方法能够实现以物体为中心的测试时优化和梯度路由,隔离运动变化同时保持被动环境。在PhyGenBench和Physics-IQ等基准上的评估表明,PhysPlan在物理理解方面显著优于现有的视频生成模型。

  2. RESEARCH · CL_179099 ·

    新框架通过视觉令牌和自我诊断增强视觉语言模型推理能力 · 跟踪3个来源

    研究人员开发了新的框架来增强视觉语言模型(VLMs)的推理能力。其中一种方法,Chain-of-Visual-Thought(COVT),使用连续的视觉令牌来捕获密集的感知信息,当集成到Qwen2.5-VL和LLaVA等模型中时,在各种基准测试上的性能提高了3-16%。另一种方法,ReGround,通过使VLMs能够自我诊断和重新检查视觉证据,解决了多步推理中视觉基础丢失的问题,在视觉密集型任务上显示出持续的收益,并且推理开销适中。此…