一项名为VQABench的新基准已被开发出来,用于评估基于云的视觉语言模型(VLM)在视觉问答(VQA)系统中的成本-质量权衡。研究强调,客户端输入预处理技术虽然提供了潜在的优化,但并非普遍适用于所有模型或任务。该研究分析了四种商用VLM和三个VQA数据集上的12种预处理方法,涉及超过95,000次API调用。研究结果表明,预处理的有效性高度依赖于特定的VLM、API提供商和任务表述,选择不当的策略可能会增加成本并降低准确性。 AI
影响 为优化VQA系统提供了关键见解,在基于云的VLM部署中平衡答案质量与成本和延迟。
排序理由 该集群包含一篇研究论文,详细介绍了用于评估基于VLM的VQA系统的新基准。
在 arXiv cs.IR (Information Retrieval) 阅读 →
- alphaXiv
- arXiv
- CatalyzeX
- Cloud VLM-based VQA Systems
- DagsHub
- Gotit.pub
- Hugging Face
- ScienceCast
- Vision--Language Models
- VQABench
- Connected Papers
- CORE Recommender
- Litmaps
- scite Smart Citations
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →