研究人员开发了一种新的方法来训练多模态大语言模型(MLLMs),使其能够高效地使用缩放工具,而无需进行大量的监督微调。该方法利用了 InfoNCE 风格的奖励,并以对比负面工具调用的课程作为训练信号。在 HRBench 和 MME-RealWorld 等基准测试上的实验表明,该方法具有竞争力且效率更高,即使在直接替代监督微调时也优于基线。还引入了一个名为 Muffin&Chihuahua 的新数据集,专门用于衡量缩放能力,结果显示召回率与最终任务性能高度相关。 AI
影响 引入了一种更高效的 MLLMs 训练方法,有望提高它们处理高分辨率图像和复杂视觉任务的能力。
排序理由 详细介绍多模态大语言模型新训练方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- HRBench
- Hugging Face
- Influence Flower
- MME-RealWorld
- Muffin&Chihuahua
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →