PulseAugur
实时 06:51:29
实体 MLLM-as-a-Judge

MLLM-as-a-Judge

PulseAugur coverage of MLLM-as-a-Judge — every cluster mentioning MLLM-as-a-Judge across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_239312 ·

    新的PRISM-Bench评估文本到视频生成中的音频

    研究人员推出了PRISM-Bench,这是一个专门用于评估文本到音频视频(T2AV)系统音频生成能力的新基准。与以往将音频视为次要或孤立评估的基准不同,PRISM-Bench侧重于音频质量、与视觉的连贯性、表现力和提示遵循度。它使用一个包含900个经过人类验证的样本的数据集和一个MLLM-as-a-Judge协议来确保可靠的评分,并显示出与人类评估者的高度一致性。该基准的分析表明,当前的T2AV模型在复杂的音频接地方面存在困难,尤其是…

  2. RESEARCH · CL_197790 ·

    新的多模态基准和代理旨在促进人工智能商业构思

    研究人员开发了MBA-Bench,这是一个新颖的多模态基准,旨在训练和评估用于真实世界商业构思的人工智能代理。该基准包含六个领域中的30,000个样本,融入了超越纯文本描述的视觉线索。提出的MBA-b和MBA-k代理使用LoRA微调和具有创造力及可行性奖励的策略优化进行训练,其性能显著优于纯文本和现有的多模态基线。

  3. RESEARCH · CL_148028 ·

    新基准MultiRef-Compass评估多参考视听生成

    研究人员推出了MultiRef-Compass,一个旨在评估多参考到视听(MR2AV)生成的新基准。该基准通过专注于从多个参考和文本指令生成连贯视听内容的复杂任务,解决了现有方法的局限性。MultiRef-Compass包含350个精选样本和一个四维评估协议,结合了自动指标和MLLM-as-a-Judge框架,以评估感知保真度和参考条件组合。