PulseAugur
实时 09:04:42
实体 VATEX

VATEX

PulseAugur coverage of VATEX — every cluster mentioning VATEX across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 4
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 6 条
  1. TOOL · CL_254945 ·

    新型 HyVol 模块提升多模态检索准确性

    研究人员开发了一种名为超图正则化格拉姆体积(HyVol)的新型训练时模块,以增强多模态检索系统。该模块通过使用超图连接模态和相关候选对象来整合训练样本之间的语义关系。HyVol 在嵌入而非最终分数上运行,允许在训练后移除而不改变骨干架构或检索成本。在 MSR-VTT 和 VATEX 等基准测试上的实验显示,检索准确性显著提高,尤其是在视频到文本任务上。

  2. TOOL · CL_196224 ·

    新的WSV框架通过合成视频生成改进零样本视频字幕生成

    研究人员开发了一个名为WSV的新框架,用于零样本视频字幕生成,该框架解决了仅文本训练与基于视频的推理之间的跨模态差距。该方法包括使用文本到视频模型生成合成视频潜在表示,然后由一个抛光器进行细化以提高保真度。最后,一个提示器根据这些抛光后的表示对GPT-2进行条件化以生成字幕。该方法在MSVD、MSR-VTT和VATEX数据集上的B@4得分达到52,CIDEr得分达到95.7。

  3. TOOL · CL_180206 ·

    新的PHA-Net通过原型对齐改进文本-视频检索

    研究人员开发了PHA-Net,一种用于文本-视频检索的新型网络,它利用共享原型来有效地对齐跨模态表示。该方法通过增强具有强语义的token并抑制较弱的token来解决文本和视频之间的语义不匹配问题。PHA-Net在多个基准测试中表现出显著的改进,包括MSR-VTT、ActivityNet、VATEX和Charades。

  4. RESEARCH · CL_160958 ·

    新框架对齐文本和视频分布以改进检索

    研究人员引入了分布对齐桥梁(DAB),一个新颖的文本到视频检索框架,将任务视为分布对齐问题。DAB不进行直接匹配,而是将文本和视频嵌入建模为高斯分布,并纳入不确定性。该系统使用受扩散模型启发的桥梁,迭代地将文本分布向视频分布细化,并通过基于Kullback-Leibler散度的对比损失进行优化相似度。在MSR-VTT和VATEX等基准上的评估表明,DAB优于现有的概率和基于扩散的方法。

  5. RESEARCH · CL_53958 ·

    Google DeepMind 发布 Gemini Embedding 2 多模态模型

    Google DeepMind 推出了 Gemini Embedding 2,一个新生的原生多模态嵌入模型。该模型能够为视频、音频、图像和文本数据生成统一的表示,在各种专业领域展现出强大的零样本能力。它在关键的嵌入基准测试中取得了最先进的性能,包括多模态检索任务,并可用于 RAG、推荐系统和搜索等下游应用。

  6. TOOL · CL_49297 ·

    新GLCCL方法提升文本-视频检索准确性

    研究人员开发了一种名为全局-局部对比一致性学习(GLCCL)的新方法,以改进文本-视频检索。该方法使用一个无参数模块,在文本查询的指导下,从视频帧和完整视频中生成语义特征。采用了一种新颖的对比分数一致性损失函数,以增强模型区分相关和不相关视频-文本对的能力,从而在基准数据集上取得卓越的性能。