一项题为MIRAGE的新研究介绍了一个用于多模态大型语言模型(MLLM)代理的受控评估框架,重点关注它们在对话中检索和利用历史证据的能力。研究揭示了基于对话状态的证据使用的不同失败模式,特别指出开放权重模型在来源受损时难以处理上下文连续性和通过工具进行的检索。研究结果表明,当前的仅结果评估可能高估了代理的能力,需要一种考虑状态变化的更细致的方法。 AI
影响 强调了对AI代理的记忆和证据检索能力进行更严格评估的必要性。
排序理由 该集群包含一篇研究论文,详细介绍了新的评估框架和关于多模态代理的研究结果。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- Connected Papers
- DagsHub
- Gotit.pub
- Hugging Face
- Litmaps
- MIRAGE
- multimodal large language model
- ScienceCast
- Scite
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →