研究人员调查了预训练的 2D 检测 Transformer(如 DETR)的 3D 物体级理解能力。他们的发现表明,尽管这些模型仅在 2D 数据上进行训练,没有明确的 3D 监督,但它们却拥有表示物体深度和相对于相机 3D 位置信息的显著能力。这表明这些模型在从 2D 嵌入中推断 3D 属性方面具有先前未被认识到的能力。 AI
影响 揭示了 2D 视觉模型在推断 3D 信息方面的一项意外能力,可能影响未来的模型架构和训练策略。
排序理由 该集群包含一篇详细介绍人工智能模型能力新研究发现的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →