研究人员开发了 RENDEQ,一种用于生成科学图表语义等效重新渲染的工具,以更好地衡量模型在扰动输入上的共识与其实际正确性之间的关系。在三个开源视觉语言模型 (VLM) 上进行测试,他们发现与重采样相比,重新渲染提高了准确性和可靠性。然而,在模型自身的交叉渲染共识上进行微调会导致准确性下降,这与之前在自然图像上的发现相矛盾,并表明奖励共识的目标会损害性能。 AI
影响 引入了一种评估 VLM 可靠性的新颖方法,有可能改进模型共识用于预测正确性的方式。
排序理由 该集群包含一篇详细介绍新方法和实验结果的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →