PulseAugur
中
实时 07:42:34
实体 Video Captioning by Adversarial LSTM

Video Captioning by Adversarial LSTM

PulseAugur coverage of Video Captioning by Adversarial LSTM — every cluster mentioning Video Captioning by Adversarial LSTM across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 3
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
  1. RESEARCH · CL_227252 ·

    新AI模型在手语识别和生成方面取得进展

    研究人员开发了超越传统闭集分类的新型手语识别和生成方法。一种方法利用视频字幕和描述检索来创建一个能够处理开放词汇和连续手语的反向手语词典,在识别已见和未见手语方面均有显著改进。另一种方法SignSeek通过对比学习手语并使用发音部位显著性引导掩码来学习手语词典检索的可迁移表示,在多种手语上取得了最先进的性能,甚至无需微调即可泛化到未见过的手语。SignMatch也通过学习原型结构嵌入空间来匹配词典手语与连续视频,展示了有效的跨语言泛化…

  2. TOOL · CL_138250 ·

    新框架通过声明级奖励改进视频字幕

    研究人员引入了声明级评分奖励(CuRe),一种用于密集视频字幕强化学习的新框架。该方法旨在克服现有奖励设计的局限性,例如整体判断和基于参考的评估,这些可能导致奖励破解或过于僵化的文本对齐。CuRe使用结构化评分表将字幕分解为原子声明,从而实现更可靠、更细粒度的验证。

  3. RESEARCH · CL_100239 ·

    新的AI框架解决了视觉模型错误和事件相机数据处理问题 · 跟踪3个来源

    研究人员推出了一种名为Gazer的新型框架,该框架通过整合来自多模态大型语言模型的反馈来改进自回归视觉模型(AVMs)。Gazer分两个阶段进行:诊断中间生成状态的语义错误,然后纠正生成轨迹。这种方法在无需额外训练的情况下提高了图像和视频合成的语义对齐和组合准确性。此外,还开发了一个名为CapRiCorn-1K的新基准来评估视频字幕和主体指代一致性,结果显示当前模型在这些任务上存在困难,尤其是在视频时长增加时。另外,还提出了一个名为N…