研究人员推出了CLBench-V,这是一个旨在评估多模态AI模型如何从上下文中学习的新基准,它超越了纯文本,纳入了图表和图像。该基准在三个维度上评估模型:上下文基础、新信息应用和新知识学习。在六个最新模型和超过3400个实例的测试中,最高得分仅为0.2847,表明多模态上下文学习仍有很大的改进空间。InternVL3.5-30B-A3B在上下文基础和知识获取方面表现出色,而Qwen3.5-Plus在应用新信息方面表现出优势。 AI
影响 突显了当前多模态AI能力的一个关键差距,可能指导未来研究朝着更强大的上下文感知系统发展。
排序理由 该集群描述了一个用于评估AI模型的新学术基准。
在 Hugging Face Daily Papers 阅读 →
- alphaXiv
- arXiv
- CatalyzeX
- CLBench-V
- DagsHub
- Gotit.pub
- Hugging Face
- InternVL3.5-30B-A3B
- Qwen3.5-Plus
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →