研究人员推出了 CLBench-V,一个旨在评估多模态 AI 模型从上下文中学习能力的基准。该基准通过结合现有和新创建的数据集,在三个维度上评估模型:上下文基础、新信息应用和新知识学习。对六个近期多模态模型的初步评估显示,当前能力远未饱和,总体最高得分仅为 0.2847。InternVL3.5-30B-A3B 在上下文基础和新知识学习方面表现出色,而 Qwen3.5-Plus 在应用新信息方面表现出优势。 AI
影响 凸显了当前多模态 AI 从多样化上下文学习能力方面的显著差距,为未来的研究和开发指明方向。
排序理由 该条目是一篇介绍 AI 模型评估新基准的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- CLBench-V
- DagsHub
- Gotit.pub
- Hugging Face
- InternVL3.5-30B-A3B
- Qwen3.5-Plus
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →