PulseAugur
实时 14:08:26
实体 Hubert

Hubert

PulseAugur coverage of Hubert — every cluster mentioning Hubert across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
4
90 天内 27
发布 · 30天
0
90 天内 0
论文 · 30天
4
90 天内 26
层级分布 · 90 天
主题
关系
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/2 页 · 共 27 条
  1. TOOL · CL_210513 ·

    Gemini 2.5-Flash 在真实人机交互关系估计研究中领先

    一篇新的 arXiv 论文探讨了真实人机交互(HRI)场景下的多模态关系估计,超越了受控的实验室环境。研究人员发现,零样本大型语言模型(LLMs)表现良好,其中 Gemini 2.5-Flash 显示出特别的优势。一种结合 Gemini 的文本能力与音频(HuBERT)和视觉(V-JEPA)模型的融合模型取得了最佳的整体性能,这表明在动态的真实场景中,准确的关系估计需要多种模态的结合。

  2. TOOL · CL_206453 ·

    新的无参数方法评估大象发声的少样本学习

    研究人员开发了一种无参数的方法来评估大象发声分类中的少样本学习。该方法在固定的声学嵌入上使用最近邻分类器,并将其性能与在不同数据集和样本数量上的全训练模型进行比较。这种无参数方法显示出潜力,尤其是在Elephant Voices等低资源数据集上,在标记示例稀缺时,它可以优于训练过的分类器。

  3. TOOL · CL_193817 ·

    AI模型无需标签即可通过面部和语音筛查帕金森病

    研究人员开发了一种新颖的方法,仅使用面部表情和语音分析来筛查帕金森病,无需直接的PD标签。该方法利用了冻结的预训练编码器,特别是用于面部数据的Vision Transformer和用于语音的HuBERT。当融合两种模态时,该系统实现了0.802的AUROC,显示出在临床环境中进行排除性分诊的潜力。

  4. TOOL · CL_156449 ·

    新的PINT方法从语音中提取不变的语言内容

    研究人员开发了一种名为PINT(并行不变标记化)的新方法,通过关注不同话语中保持一致的语言内容来改进语音标记化。该技术对自监督学习模型进行微调,以提取共享的语义信息,减少说话人身份、韵律和声道条件的影响。实验表明,说话人探测准确率和ABX错误率显著降低,表明PINT能有效捕获不变的语言内容,从而实现更高效的学习和音频编解码器等应用。

  5. RESEARCH · CL_145743 ·

    CF-Net 使用多模态融合进行矛盾和犹豫识别

    研究人员开发了 CF-Net,一个深度多模态网络,用于识别视频中的矛盾和犹豫。该网络利用冻结的 SigLIP2、HuBERT 和 DistilBERT 主干来处理视觉、音频和转录数据。CF-Net 包含一个冲突融合模块来计算跨模态不一致性,以及说话人归一化来减少身份泄露。该模型在 BAH 数据集上取得了强劲的性能,在私有挑战测试集上达到了 0.7364 的宏观 F1 分数。

  6. TOOL · CL_149070 ·

    ai-sage 发布 GigaAM Multilingual 语音模型

    ai-sage 发布了 GigaAM Multilingual,这是一系列基于 Conformer 的基础模型。这些模型有 2.2 亿和 6 亿参数的变体,已在超过 70 种语言的 200 万小时以上语音数据上进行了预训练。它们针对自动语音识别 (ASR) 进行了微调,在俄语、哈萨克语、吉尔吉斯语和乌兹别克语方面提供顶级开源性能,在英语方面性能中等。

  7. RESEARCH · CL_139195 ·

    AI系统在视频分析中提升矛盾和犹豫识别能力 · 跟踪8个来源

    研究人员开发了识别视频中矛盾和犹豫的先进方法,参加了第11届ABAW挑战赛。其中一种方法,HSEmotion团队的系统,利用多任务学习,结合冻结的轻量级面部提取器和后处理技术来预测效价、唤醒度、面部表情和动作单元。另一个系统SVF-CR采用同步视觉-面部交叉精炼框架进行多模态证据融合。第三种方法侧重于简单特征和诚实校准,引入“ASR擦除时间”来捕捉犹豫停顿,并使用称为情感标记融合的可靠性门控。

  8. RESEARCH · CL_135171 ·

    语音合成评估受自动语音识别家族对齐干扰,提出新的集成方法

    研究人员发现,在使用自动语音识别(ASR)验证器评估文本到语音(TTS)系统时存在一个重大的混淆因素。这些验证器的表面质量很大程度上受用于判断的ASR家族影响,导致排名颠倒和性能指标虚高。为解决此问题,该论文提出跨家族排名集成方法,该方法可实现更低的词错误率,并在其他指标上保持性能,建议进行跨评估器三角测量以获得稳健的报告。

  9. RESEARCH · CL_128887 ·

    新的音节分词器通过解耦说话人身份来改善语音理解

    研究人员开发了一种新颖的说话人解耦音节分词器,通过在固定长度块内将受说话人扰动的表示回归到干净的目标,来改进无监督音节分词。该方法解决了模型预测说话人身份而非语言内容的问题,这是语篇级交叉熵目标常见的问题。所提出的方法在音节边界检测和聚类方面取得了最先进的结果,并且使用这些标记训练的语音语言模型在句法和语义理解方面比 SpiRit-LM 提高了 7% 的相对改进。

  10. RESEARCH · CL_121415 ·

    New evaluation set disentangles speaker and language effects in cross-lingual verification

    研究人员为跨语言说话人验证(SV)系统开发了一个新的评估集,重点关注伊比利亚语种。该设置允许在一致的说话人身份下分析跨语言SV,解决了标准协议中将语言不匹配与说话人之间差异混淆的局限性。该研究将此应用于基于HuBERT的SV系统,发现虽然说话人差异会影响性能下降,但语言不匹配是跨语言性能损失的主要驱动因素。

  11. TOOL · CL_117978 ·

    BabyHuBERT模型改进了儿童语音录音中的说话人分割

    研究人员开发了BabyHuBERT,这是一种新颖的自监督语音模型,专门针对多语言、以儿童为中心的 */长录音*/ 进行训练。该模型旨在改进 */幼儿*/ 录音中的说话人分割,这对于语言发展研究至关重要,但现有 */成人语音*/ 训练的模型处理效果不佳。BabyHuBERT在 */多种语料库*/ 的 */语音类型分类*/ 任务上表现出卓越的性能,尤其是在 */瓦努阿图*/ 和 */所罗门群岛*/ 等 */代表性不足的语言*/ 上取得了显著的进步。

  12. TOOL · CL_117813 ·

    MauBERT论文介绍多语言语音表示用于语音模型

    研究人员开发了MauBERT,这是HuBERT自监督学习模型的一个多语言扩展。通过整合55种语言的发音特征和语音到发音的映射,MauBERT学习了与语言无关的语音表示。与现有的多语言模型相比,这种方法展示了更优越的上下文不变表示,并能够以最小的微调有效地适应新语言。

  13. TOOL · CL_115707 ·

    WavLM 通过数据增强技术推进语音用力分类

    研究人员利用 WavLM 模型在基于说话人的语音用力分类方面取得了进展,其性能优于 Wav2Vec2 和 HuBERT 等先前的方法。为了应对数据稀缺问题,他们系统地研究了各种增强策略,包括 RIR 卷积、加性噪声、时间掩码、速度扰动、带限、MixUp 和 CutMix,这些策略一致提高了 WavLM 的性能。通过模拟语音用力连续体以减少相邻类别之间的混淆的高斯邻域软标签,进一步实现了性能提升。表现最佳的系统,即采用渐进式解冻、增强和…

  14. TOOL · CL_104735 ·

    研究发现:语音模型在早期层级编码儿童的年龄/性别

    研究人员分析了自监督学习(SSL)模型在儿童语音中捕获年龄和性别信息的有效性。该研究聚焦于四种模型:Wav2Vec2、HuBERT、Data2Vec 和 WavLM,并使用 PFSTAR 和 CMU Kids 数据集检查了它们的层级。结果表明,早期到中期层级在编码这些副语言线索方面最有效。HuBERT 在年龄分类方面表现最佳,而 Wav2Vec2 和 HuBERT 在性别分类方面领先。

  15. TOOL · CL_100071 ·

    Transformer模型在古兰经自动语音识别方面准确性有所提高

    研究人员对用于古兰经自动语音识别(ASR)的预训练Transformer模型进行了比较研究,旨在降低用户诵读经文时的高词错误率(WER)。该研究在870小时的古兰经数据集上微调了Wav2Vec2.0、HuBERT和XLS-R等模型,确定了转录准确性的关键因素。最佳配置在EveryAyah子集上实现了0.08的WER,相比Citrinet基线有了显著改进,同时还缩短了训练时间。

  16. TOOL · CL_93444 ·

    新的LM-SPT方法增强语音分词,以实现更好的语言模型对齐

    研究人员开发了一种新颖的语音分词方法LM-SPT,旨在改善语音与语言模型之间的对齐。与直接蒸馏特征或使用池化的先前方法不同,LM-SPT采用语义语音再合成蒸馏过程。这种间接监督方法鼓励创建与语言模型更对齐的专用语义单元,即使在降低的帧率下也能实现,并且在自动语音识别和文本到语音任务中表现出卓越的性能,同时不牺牲语音重建保真度。

  17. TOOL · CL_82577 ·

    新数据集通过语言线索增强AI对深度伪造音频的检测能力

    研究人员推出了Linguistically Augmented Audio Speech Data (LinguAS),这是一个旨在对抗深度伪造音频日益增长的新数据集。LinguAS包含超过800个真实和伪造的音频样本,并标注了五个自然人类语音的典型语言特征。通过整合这些语言线索和音频特征,在LinguAS上训练的模型在检测音频深度伪造方面,相比现有基线模型表现出显著的性能提升。

  18. RESEARCH · CL_84473 ·

    语音模型泛化识别稀有舌侧塞音

    研究人员调查了自监督语音模型是否能准确识别不常见的语音声音,特别是科伊桑语系中发现的舌侧塞音。通过在 G|ui 和 West !Xoon 的数据上微调 Wav2Vec2 和 HuBERT 等模型,他们发现这些模型确实比非舌侧塞音更能有效地识别舌侧塞音。这表明自监督学习使这些模型能够跨越更广泛的人类音素进行泛化,即使是那些在典型训练数据中很少遇到的音素。

  19. TOOL · CL_80102 ·

    AI模型通过多模态语音分析检测帕金森病

    研究人员开发了一种新颖的多分支深度学习框架,旨在通过语音分析提高帕金森病的检测率。该方法利用三种不同的语音表征:Log-Mel频谱图、MFCC和HuBERT嵌入,每种都由专门的神经网络处理。一项关键创新是上下文引导的跨模态注意力机制,它动态地整合这些不同的特征,从而提高了疾病识别的准确性。

  20. TOOL · CL_72674 ·

    GeMCL算法扩展少样本语音词分类

    研究人员开发了一种名为生成式元持续学习(GeMCL)的新方法,以改进少样本语音词分类。该方法允许模型以每个类别仅五个样本的条件,顺序学习区分1000个类别。与传统的微调或重复训练方法相比,GeMCL表现出稳定的性能和显著更快的适应速度,同时使用了更少的数据和计算资源。