PulseAugur
中
实时 17:57:26
实体 Video-MLLM

Video-MLLM

PulseAugur coverage of Video-MLLM — every cluster mentioning Video-MLLM across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_287209 ·

    新框架确立视频分析中的角色身份

    研究人员开发了一个新的身份感知视频字幕和问答框架,该框架明确地将角色身份定位在视频片段中。该方法结合了自动角色识别、使用边界框的空间定位以及视觉-语言模型的任务特定适应。该框架在LSMDC v2数据集上进行了测试,并显示出显著的改进,特别是对于像GPT 5.6 "Sol"这样的大型模型以及微调后的Qwen模型(称为BAC-8B)而言,它们在识别角色和回答有关其行为的问题方面取得了高精度。

  2. TOOL · CL_156584 ·

    新的DAER框架使视频多模态大语言模型能够适应不断变化的域

    研究人员推出了一种名为分布感知专家路由(DAER)的新型框架,旨在增强视频多模态大语言模型(Video-MLLMs)在不断变化的域上的适应能力。DAER采用参数高效、域隔离的轻量级专家,同时保持核心Video-MLLM冻结,以防止灾难性遗忘和跨域干扰。该系统包含一个域内路由机制,使用最大均值差异(MMD)将输入与专家原型进行匹配;以及一个在推理时无需任务身份即可进行鲁棒域识别的域间路由机制。在对十个VidQA数据集精心策划的基准测试中…