研究人员推出ExBind,一个旨在评估多模态模型将视觉或语义参考映射到特定可执行对象准确性的新型诊断基准。该基准隔离了视觉到可执行代码的对应层,超越了简单的执行成功,以查明对象选择中的失败。ExBind包含一套广泛的250个案例和一套有针对性的240个案例,格式包括SVG、DOM和表格等。早期评估显示,Qwen2.5-VL-3B在该基准上实现了76.4%的精确准确率,而Qwen3-VL-4B达到了98.8%的精确准确率。 AI
影响 该基准有望推动多模态模型在准确解释和交互视觉界面方面的能力得到提升。
排序理由 该条目描述了一个用于评估多模态模型的新基准,发表在arXiv论文中。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →