实体
MLLM-as-Judge
MLLM-as-Judge
PulseAugur coverage of MLLM-as-Judge — every cluster mentioning MLLM-as-Judge across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
AI模型在视觉隐喻生成方面遇到困难,新的基准测试显示
两篇研究论文探讨了使用AI生成视觉隐喻。第一篇论文介绍了VMetaphor-Bench,这是一个用于评估文本到图像模型创建视觉隐喻能力的基准测试,发现当前模型在组合结构和跨领域映射方面存在困难。第二篇论文提出了一个名为视觉隐喻迁移(VMT)的新任务和一个受概念融合理论启发的多代理框架来实现这一目标,在隐喻一致性和创造性方面表现出优越的性能。
-
新的Sci-VBench基准揭示AI科学视频生成能力的差距
研究人员推出了Sci-VBench,这是一个旨在评估AI模型在科学领域生成视频能力的新基准。该基准包含自然科学、医疗保健、人文学科和工程学领域超过1200个专家标注的示例,要求模型展示科学推理和知识综合能力。对16个模型的初步评估显示,专有系统和开源系统之间存在显著差距,尤其是在科学和因果正确性方面,这表明尽管视觉真实性有所提高,但当前的视频生成模型在准确表示复杂动态方面仍面临挑战。