PulseAugur
中
实时 16:53:30
实体 2D Vision-Language Models

2D Vision-Language Models

PulseAugur coverage of 2D Vision-Language Models — every cluster mentioning 2D Vision-Language Models across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_275419 ·

    Lang3DSeg 实现免标注的 3D LiDAR 分割

    研究人员开发了 Lang3DSeg,一种用于开放词汇 3D LiDAR 分割的新型点 Transformer 模型。该方法通过将 2D 视觉-语言模型投影到 3D 数据上来绕过手动标注的需求,并通过类别优先级规则和深度分布截断来解决深度模糊等挑战。Lang3DSeg 在 nuScenes 和 SemanticKITTI 基准测试中,在免标注方法方面取得了最先进的成果,并且无需同时进行视觉-语言模型推理即可在单次 LiDAR 扫描中实现实时运行。

  2. TOOL · CL_68496 ·

    新方法通过分层视图到令牌传输改进零样本三维问答

    研究人员开发了一种名为KeyVT的新型分层方法,用于使用二维视觉语言模型进行零样本三维问答。该方法通过根据语义内容和几何位置选择重要的二维视图来提高输入上下文质量,同时减少图像块之间的冗余。KeyVT采用最优传输来识别能够有效覆盖所有视图特征的代表性令牌,从而在基准数据集上取得了显著的性能提升。