PulseAugur
中
实时 08:34:52
实体 Multimodal Large Language Model (MLLM)

Multimodal Large Language Model (MLLM)

PulseAugur coverage of Multimodal Large Language Model (MLLM) — every cluster mentioning Multimodal Large Language Model (MLLM) across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_154599 ·

    新数据集和模型推动AI生成视频质量评估进展

    研究人员推出了HVEval+,这是一个用于评估AI生成的人类中心视频质量的大型数据集,在先前HVEval数据集的基础上增加了成对偏好标注。该新数据集包含1000个提示、来自24个文本到视频模型的视频,以及涵盖空间质量、时间质量和文本-视频对应关系的广泛人工标注。除了数据集,研究团队还提出了MoE-Rater,这是一种基于多模态大型语言模型的评估方法,旨在单一框架内实现多维度质量评分、比较和问答。

  2. RESEARCH · CL_63038 ·

    新研究解决了视频生成在控制、一致性和效率方面的挑战

    研究人员正在开发先进的视频生成技术,重点是提高控制、一致性和效率。CineOrchestra 旨在统一对电影视频中主体、摄像机和镜头转换的控制。TetherCache 通过管理缓存内存来解决长格式自回归视频生成中的漂移和质量下降问题。Argus 使用新颖的身份注入方法来增强在各种挑战性条件下的主体保留能力。MilliVid 采用分层潜在空间来实现长程一致性,而 RhymeFlow 通过解耦去噪轨迹来加速扩散变换器。Echo-Infin…