CSL-Daily
PulseAugur coverage of CSL-Daily — every cluster mentioning CSL-Daily across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
手语生成方法SignRR结合检索与精炼
研究人员开发了一种名为SignRR的新手语生成方法,旨在从口语生成连续的手语动作。该方法结合了真实动作片段的检索和一个使用部分感知残差VQ-VAE的精炼过程。SignRR框架通过保留精细的手部关节细节并解决拼接动作片段时出现的 the inconsistencies,改进了现有方法。在PHOENIX14T和CSL-Daily数据集上的实验表明,SignRR在反向翻译方面取得了最先进的性能,同时保持了具有竞争力的姿态质量。
-
SMART框架在MLLM的指导下统一了手语识别和识别
研究人员开发了SMART,一个利用多模态大语言模型(MLLM)统一手语识别和识别的新框架。该方法利用MLLM生成的运动描述作为语义线索,以改善视频-文本对齐,即使在小批量大小的情况下也是如此,这对于内存密集型手语视频训练至关重要。SMART还增强了时序表示学习和密集时序定位,并在四个基准数据集上证明了其有效性。
-
受常微分方程启发的动力学增强手语翻译模型
研究人员通过常微分方程(ODE)的视角重新诠释了Transformer解码器的迭代细化过程,开发了一种新颖的手语翻译方法。该方法用高阶数值积分方案(如Runge--Kutta方法(RK-2和RK-4))取代了标准的残差细化更新。这些受ODE启发的动力学在不增加模型大小的情况下增强了表示更新,为扩展模型容量提供了一种参数高效的替代方案。在PHOENIX-2014-T和CSL-Daily数据集上的实验表明,RK-2的性能优于IPSLT基线…
-
发布新的手语问答任务和基准
研究人员推出了一项名为手语问答(SLQA)的新任务,以更好地评估超越简单识别或翻译的手语理解能力。该任务要求模型回答关于手语视频的自然语言问题,评估更广泛的推理能力。为了支持SLQA,创建了两个基准数据集SignQA,使用了PHOENIX14T和CSL-Daily,包含五类(如位置推理和视觉搜索)的问答对。还提出了一个包含问答条件调制时间降采样模块的基线模型,该模型在这些基准上的表现优于现有的视觉语言模型。
-
新的DualAnchor框架提高了手语翻译的准确性
研究人员开发了DualAnchor,这是一个新的手语翻译(SLT)框架,旨在提高翻译文本的流畅性和词汇细节的准确性。该框架解决了两个关键问题:语言先验退化,即现有方法未能充分利用大型语言模型(LLM)的全部能力;以及词汇保真度差距,即句子级对齐未能实现细粒度的词语准确性。DualAnchor采用Token级先验锚定(TPA)来保持LLM的语言先验,并采用最优传输对齐(OTA)来增强视觉-文本匹配,在PHOENIX-2014T和CSL-…
-
新的扩散模型生成生物力学上可行的3D手语
研究人员开发了PIDiffSign,这是一种新颖的、面向物理信息的扩散模型,旨在根据口语输入生成生物力学上可行的3D手语。该模型将解剖学约束直接纳入其架构和训练目标,解决了先前方法中允许不切实际的骨骼运动的局限性。通过强制执行骨骼长度一致性和有效的关节角度,PIDiffSign旨在提高生成运动的真实感和手语输出的语义准确性,并在基准数据集上显示出有希望的结果。
-
新框架推动实时手语翻译 · 已追踪2个来源
两篇新研究论文提出了手语翻译(SLT)的进展。一篇论文详细介绍了一个面向实时句级SLT的硬件感知流式系统,在How2Sign数据集上微调了SHuBERT-ByT5模型,并实现了低延迟。另一篇论文介绍了VTaMo,一个使用显式多粒度对齐来改进无手语词SLT的框架,在多个基准数据集上展示了最先进的性能。
-
新型多模态LLM在无词汇手语翻译方面达到最先进水平
研究人员开发了ViPo-MLLM,一个新颖的多模态大型语言模型,用于无词汇手语翻译。该框架整合了时空RGB数据和人体姿态特征,采用专用的编码器处理模态内动力学,并利用跨模态注意力处理长距离依赖。ViPo-MLLM在PHOENIX14T和CSL-Daily数据集上取得了新的最先进成果,展示了与基于词汇的方法相比具有竞争力的性能。
-
SIGNET框架通过运动知识迁移实现跨语言手语翻译
研究人员开发了SIGNET,一个旨在通过在不同手语之间迁移运动级知识来改进跨语言手语翻译的新框架。该方法利用预训练模型捕获可重用的视觉模式,并通过基于注意力的机制整合多个专家骨干网络。SIGNET在多个基准测试中展示了最先进的性能,包括How2Sign、Phoenix14T和CSL-Daily,并在手语识别的WLASL数据集上取得了优异的结果。
-
新框架推动手语生成与评估的进展
研究人员开发了SIGNER,一个用于从文本生成手语的新框架,该框架解决了时间对齐方面的局限性。通过使用时间解析的条件约束和局部时间融合,SIGNER确保了生成手语的正确词汇顺序和语义准确性。此外,还引入了一个名为BackTranslation2.0的新评估指标来评估手语生成,该指标使用了一个基于代理的框架和基于LLM的交叉引用模块,与以往的方法相比,提供了更具语言学基础的评估。
-
新的LLM和编码方法提升手语翻译能力
研究人员正在探索利用大型语言模型(LLM)和先进的编码技术来改进手语翻译(SLT)的新方法。一种方法使用GPT-4o生成释义的目标句子,以增强训练数据,提高翻译质量,尤其是在词汇量稀疏的语言中。另一种方法FEA-SLT将面部表情作为语义锚点,以解决手动手语配置中的歧义,在无词汇方法中取得了最先进的成果。此外,SAGE框架引入了段感知视觉标记,通过缩短输入序列长度来创建更高效、可扩展的无词汇SLT模型。
-
新方法通过选择性对比学习和偏好优化增强无词汇手语翻译
研究人员开发了新的方法来改进无词汇手语翻译,解决了将视觉手语视频与口语文本对齐的挑战。一种方法,手语翻译的选择性对比学习(SCL-SLT),使用对选择策略来识别和强调训练过程中信息量更大的负面示例,减少来自语义相似对的噪声。另一种方法,SignDPO,采用跨空间、时间、语言维度的多层次直接偏好优化来增强基于骨骼的手语翻译,其性能优于现有的无词汇技术。