PulseAugur
实时 07:51:42
实体 PHOENIX14T

PHOENIX14T

PulseAugur coverage of PHOENIX14T — every cluster mentioning PHOENIX14T across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 7
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 7
层级分布 · 90 天
主题
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/1 页 · 共 7 条
  1. TOOL · CL_174331 ·

    发布新的手语问答任务和基准

    研究人员推出了一项名为手语问答(SLQA)的新任务,以更好地评估超越简单识别或翻译的手语理解能力。该任务要求模型回答关于手语视频的自然语言问题,评估更广泛的推理能力。为了支持SLQA,创建了两个基准数据集SignQA,使用了PHOENIX14T和CSL-Daily,包含五类(如位置推理和视觉搜索)的问答对。还提出了一个包含问答条件调制时间降采样模块的基线模型,该模型在这些基准上的表现优于现有的视觉语言模型。

  2. RESEARCH · CL_147844 ·

    新的扩散模型生成生物力学上可行的3D手语

    研究人员开发了PIDiffSign,这是一种新颖的、面向物理信息的扩散模型,旨在根据口语输入生成生物力学上可行的3D手语。该模型将解剖学约束直接纳入其架构和训练目标,解决了先前方法中允许不切实际的骨骼运动的局限性。通过强制执行骨骼长度一致性和有效的关节角度,PIDiffSign旨在提高生成运动的真实感和手语输出的语义准确性,并在基准数据集上显示出有希望的结果。

  3. TOOL · CL_128846 ·

    新型多模态LLM在无词汇手语翻译方面达到最先进水平

    研究人员开发了ViPo-MLLM,一个新颖的多模态大型语言模型,用于无词汇手语翻译。该框架整合了时空RGB数据和人体姿态特征,采用专用的编码器处理模态内动力学,并利用跨模态注意力处理长距离依赖。ViPo-MLLM在PHOENIX14T和CSL-Daily数据集上取得了新的最先进成果,展示了与基于词汇的方法相比具有竞争力的性能。

  4. TOOL · CL_118008 ·

    SIGNET框架通过运动知识迁移实现跨语言手语翻译

    研究人员开发了SIGNET,一个旨在通过在不同手语之间迁移运动级知识来改进跨语言手语翻译的新框架。该方法利用预训练模型捕获可重用的视觉模式,并通过基于注意力的机制整合多个专家骨干网络。SIGNET在多个基准测试中展示了最先进的性能,包括How2Sign、Phoenix14T和CSL-Daily,并在手语识别的WLASL数据集上取得了优异的结果。

  5. TOOL · CL_105071 ·

    VAE设计对生成手语模型至关重要

    研究人员探讨了变分自编码器(VAE)的设计如何影响基于扩散模型的手语生成中的潜在姿态表示。他们发现,VAE中的架构和训练目标选择显著影响潜在空间的结构。这种影响反过来会影响下游文本到手语生成模型的性能,有时比单独的传统VAE重建精度更重要,这在Phoenix14T数据集上得到了证明。

  6. TOOL · CL_68603 ·

    新型混合模型提升实时手语生成能力

    研究人员开发了HybridSign,一种融合了自回归和扩散技术的新型模型,可实现更高效、实时的手语生成。该方法旨在克服扩散模型的延迟问题和自回归模型的错误累积问题。HybridSign采用多尺度姿态表示和置信度感知因果注意力机制,以增强鲁棒性并捕捉详细的发音器官特征。在基准数据集上的实验表明,HybridSign在生成质量和速度之间取得了卓越的平衡,显著降低了延迟并提高了吞吐量。

  7. RESEARCH · CL_56374 ·

    新的LLM和编码方法提升手语翻译能力

    研究人员正在探索利用大型语言模型(LLM)和先进的编码技术来改进手语翻译(SLT)的新方法。一种方法使用GPT-4o生成释义的目标句子,以增强训练数据,提高翻译质量,尤其是在词汇量稀疏的语言中。另一种方法FEA-SLT将面部表情作为语义锚点,以解决手动手语配置中的歧义,在无词汇方法中取得了最先进的成果。此外,SAGE框架引入了段感知视觉标记,通过缩短输入序列长度来创建更高效、可扩展的无词汇SLT模型。