研究人员推出了 M$^3$R-Bench,这是一个旨在评估人工智能模型多模态隐喻理解能力的新基准。该基准包含 1,000 个图像-文本实例,评估隐喻的出现、目标-源映射、情感,并提供证据支撑的解释。评估表明,当前模型在跨模态证据映射不匹配方面存在困难。为解决此问题,开发了 M$^3$R-Reasoner 模型,该模型使用基于课程的推理监督和强化学习来改善模型推理与隐喻解释之间的一致性,其表现优于更大的专有模型。 AI
影响 该基准和模型有望提高人工智能理解细微语言和视觉上下文的能力,从而带来更复杂的多模态人工智能应用。
排序理由 该集群描述了一个用于多模态隐喻理解的新基准和提出的模型,发布在 arXiv 上。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →