研究人员推出了ReFigBench,这是一个旨在评估多模态编码代理将科学图表重建为可编辑PowerPoint工件能力的新基准。该基准使用arXiv论文中的1000张图表,并根据文本保留、拓扑结构、布局和文档结构来评估模型。评估包括自动化检查、其他模型的评分以及人工比较,结果表明,虽然专业工作流程可以提高感知质量,但它们通常会牺牲原生文档结构,这凸显了在多模态代理中平衡保真度和可编辑性的持续挑战。 AI
影响 为多模态代理建立新的评估标准,可能指导文档重建和代理工具设计方面的未来发展。
排序理由 该集群描述了一个新的AI模型基准和评估框架,属于研究范畴。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- Connected Papers
- DagsHub
- Gotit.pub
- Hugging Face
- Litmaps
- PowerPoint
- ReFigBench
- ScienceCast
- scite Smart Citations
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →