SenseNova-Vision
PulseAugur coverage of SenseNova-Vision — every cluster mentioning SenseNova-Vision across labs, papers, and developer communities, ranked by signal.
-
新的AI模型以新颖方法解决3D视觉任务
一款名为RefineAny3D的新型视觉语言模型被开发出来,用于改进单目3D目标检测的深度估计。RefineAny3D不直接预测深度,而是使用动作令牌和视觉对齐来纠正深度误差,从而提高闭集和开词汇检测器的准确性。另外,SenseNova-Vision是一个7B的开源模型,它提供了一种统一的方法来处理各种计算机视觉任务,包括分割、深度估计、目标检测、OCR和3D重建,而无需特定任务的头部。
-
商汤科技开源统一视觉模型,终结“拼凑怪兽”时代
商汤科技已将其SenseNova-Vision模型开源,标志着其从专门的“拼凑怪兽”模型转向。这款统一视觉模型将物体检测、分割、深度预测和3D重建等能力集成到单一架构中。该模型在HuggingFace Any-to-Any排行榜上名列前茅。
-
SenseNova-Vision 将计算机视觉任务统一为多模态生成 · 跟踪 6 个来源
研究人员开发了 SenseNova-Vision,一个统一的多模态模型,它将所有计算机视觉任务视为生成问题。这种方法使用自然语言指令和视觉提示来指定任务,允许模型生成文本、图像或两者的组合。该模型在新创建的 SenseNova-Vision Corpus 上进行了训练,在检测、分割和姿态估计等广泛的视觉任务上的性能与专用系统相当。这项工作表明,统一的多模态生成是一种可扩展的方法,可以将各种计算机视觉能力集成到通用基础模型中,并且该模型…
-
SenseNova-Vision 将计算机视觉任务统一为多模态生成
SenseNova-Vision 是一个新推出的多模态模型,它将计算机视觉任务重新构建为文本、图像或混合生成问题。它不使用特定任务的组件,而是通过统一的指令遵循接口来处理分割、深度预测和几何理解等各种任务。该模型的输出被设计成可以解码回各种基准测试的标准格式。