研究人员推出了ReRef-3D,一个旨在评估语言引导的3D环境物体放置能力的新基准。该基准包含超过33,000条指令,覆盖近1,000个场景,侧重于各种指代复杂性。初步评估显示,LLaVA-3D取得了最高性能,在68.3%的情况下正确放置了物体,显著优于3D-LLM和PlaceIt3D。研究还发现,诸如“最近”或“之间”等关系性难度对当前模型构成了最大挑战。 AI
影响 为评估AI模型在3D环境中的空间推理和物体操作能力树立了新标准。
排序理由 在arXiv上发布了新的基准和研究论文。
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →