研究人员推出AMBER,一个用于优化视觉-语言模型(VLMs)在多模态检索任务中使用的创新框架。AMBER通过动态分配计算资源来解决VLMs的高推理成本问题,这与之前使用固定计划的方法不同。该系统使用连续的Elo更新来维护全局排序状态,并智能地选择候选视图和查询以最大化信息增益。在CIRR、CIRCO和PhotoBench等基准数据集上的实验表明,在相似预算下,AMBER的表现优于其他多调用VLM重排序方法。 AI
影响 优化VLM推理成本,可能实现更高效的多模态检索系统。
排序理由 该集群描述了一篇详细介绍一种优化AI模型性能的新颖方法的最新研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- Adaptive Multi-view Budgeted Elo Reranking
- AMBER
- arXiv
- Bradley--Terry model
- Circo
- Compositional Image Retrieval
- Elo
- PhotoBench
- vision-language model
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →