PulseAugur
实时 06:44:18
实体 CLBench-V

CLBench-V

PulseAugur coverage of CLBench-V — every cluster mentioning CLBench-V across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_169696 ·

    新的基准 CLBench-V 揭示了多模态 AI 上下文学习的局限性

    研究人员推出了 CLBench-V,一个旨在评估多模态 AI 模型从上下文中学习能力的基准。该基准通过结合现有和新创建的数据集,在三个维度上评估模型:上下文基础、新信息应用和新知识学习。对六个近期多模态模型的初步评估显示,当前能力远未饱和,总体最高得分仅为 0.2847。InternVL3.5-30B-A3B 在上下文基础和新知识学习方面表现出色,而 Qwen3.5-Plus 在应用新信息方面表现出优势。