实体
spatial relation
spatial relation
PulseAugur coverage of spatial relation — every cluster mentioning spatial relation across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
新框架和基准推动多模态大语言模型视觉推理能力发展
研究人员正在开发新方法来增强多模态大语言模型(MLLM)的视觉推理能力。一种名为 Beacon 的方法侧重于通过智能地仅在必要时调用工具并确保工具真正扩展模型能力来改进“模式适应性”和“工具效应”。另一个框架 LanteRn 使 MLLM 能够通过将语言与紧凑的视觉表示交织在一起,直接在潜在空间中执行视觉推理。此外,正在引入 ViSTR-Bench 和 ConVBench 等新基准,以更好地评估 MLLM 在复杂时空推理和逻辑一致性方…
-
SenseNova-Vision 将计算机视觉任务统一为多模态生成 · 跟踪 6 个来源
研究人员开发了 SenseNova-Vision,一个统一的多模态模型,它将所有计算机视觉任务视为生成问题。这种方法使用自然语言指令和视觉提示来指定任务,允许模型生成文本、图像或两者的组合。该模型在新创建的 SenseNova-Vision Corpus 上进行了训练,在检测、分割和姿态估计等广泛的视觉任务上的性能与专用系统相当。这项工作表明,统一的多模态生成是一种可扩展的方法,可以将各种计算机视觉能力集成到通用基础模型中,并且该模型…