一款名为RefineAny3D的新型视觉语言模型被开发出来,用于改进单目3D目标检测的深度估计。RefineAny3D不直接预测深度,而是使用动作令牌和视觉对齐来纠正深度误差,从而提高闭集和开词汇检测器的准确性。另外,SenseNova-Vision是一个7B的开源模型,它提供了一种统一的方法来处理各种计算机视觉任务,包括分割、深度估计、目标检测、OCR和3D重建,而无需特定任务的头部。 AI
影响 这些模型推动了3D视觉任务的统一方法,有望简化复杂的感知流程。
排序理由 该集群包含两篇不同的研究论文/模型发布,均专注于计算机视觉任务。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →