两篇新的研究论文介绍了视觉基础的新方法,这项任务涉及在图像中定位文本描述的对象。第一篇论文《CoEvolve》提出了一个构建到编辑框架,将状态构建和编辑分开,以实现更明确的推理和错误纠正。该方法使用一个9B参数的模型,其准确性与多达241B参数的模型相当,并能显著从定位错误中恢复。第二篇论文《FORUM》提出了一种无需训练的方法,该方法融合了多个冻结的多模态大型语言模型的输出。通过利用模型一致性和几何规则,《FORUM》提高了在对抗性基准和标准数据集上的准确性,性能优于更大的单一模型。 AI
影响 这些用于视觉基础的新方法可以提高需要根据文本描述理解和与视觉信息交互的人工智能系统的准确性和鲁棒性。
排序理由 在arXiv上发表了两篇学术论文,详细介绍了视觉基础的新方法。
- alphaXiv
- arXiv
- Bidirectional Denoising Refiner
- CatalyzeX
- DagsHub
- FORUM
- Gotit.pub
- Hugging Face
- Region-Evolution Reinforcement
- ScienceCast
- Shunya Nagashima
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →