研究人员开发了一种使用视觉语言模型(VLM)进行去偏评估的协议,用于评估从单张图像生成的3D网格质量。该协议通过使用不同的VLM裁判进行训练和评估,并实施位置偏差校正,旨在提供比CLIP相似度或几何有效性等传统代理指标更可靠的评估。虽然该协议在识别故障模式方面被证明是有效的,并被用于调整名为TRELLIS的生成器,但调整方法在公共数据集上训练时并未超越基础模型的性能。研究表明,要超越基础性能,仅在公共数据集上进行轻量级参数高效微调是不够的,而VLM-judge协议本身可重复用于评估。 AI
影响 为评估3D生成质量建立了新的基准,可能指导该领域的未来研究和开发。
排序理由 该集群包含两篇arXiv论文,详细介绍了使用VLM评估3D网格生成质量的新协议。
- Google Scanned Objects
- VLM-Judge
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- InternVL3 8B
- Qwen2.5-VL-7B
- ScienceCast
- TRELLIS
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →