PulseAugur
实时 10:51:37
实体 FSD50K

FSD50K

PulseAugur coverage of FSD50K — every cluster mentioning FSD50K across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 5
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 5
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 5 条
  1. TOOL · CL_109976 ·

    MJEPA架构通过统一编码器简化视听学习

    研究人员推出了一种新颖的视听学习架构MJEPA,该架构使用单一的统一编码器来处理两种模态。这种方法通过采用单一的预测目标,在模态内部和跨模态进行操作,从而简化了现有方法。研究表明,跨模态预测至关重要,因为缺失跨模态预测会导致表示能力下降,而包含跨模态预测则通过利用另一种模态的优势,显著提升了每种模态的表示能力。MJEPA模型,特别是冻结的ViT-g变体,在AudioSet-20K和ESC-50等音频基准测试中表现出色,并且在视频任务上…

  2. TOOL · CL_114374 ·

    MJEPA:统一的视听学习架构揭晓

    研究人员推出 MJEPA,这是一种新颖的联合嵌入预测架构,专为视听学习而设计。该方法使用单一的统一编码器来处理两种模态,通过在模态之间和模态内部使用单一的预测目标来简化学习过程。研究表明,跨模态预测对性能至关重要,MJEPA 的表征受益于跨模态学习。MJEPA 模型取得了优异的成果,在 AudioSet-20K 上超越了之前的冻结基线,并在其他基准测试中取得了有竞争力的性能,同时使用的视频数据量显著减少。

  3. TOOL · CL_93715 ·

    AudioPG 使用合成数据进行高效音频模型预训练

    研究人员开发了 AudioPG,一个使用程序化生成的合成数据而非真实录音进行音频模型预训练的新颖框架。这种方法显著降低了训练成本、策展工作量和隐私担忧。使用 AudioPG 训练的基于 Transformer 的模型在各种真实音频基准测试中表现强劲,达到了高准确率,并在单个 GPU 上在 20 分钟内完成了预训练。对模型潜在空间的分析表明,物理声学因素出现在不同的子空间中,从而产生了可解释的表征。

  4. RESEARCH · CL_70578 ·

    新评分方法提升音频-语言AI的噪声鲁棒性

    研究人员开发了一种名为漂移增强评分(Drift-Augmented Scoring, DAS)的新技术,以提高零样本音频-语言分类模型在声学噪声下的鲁棒性。该方法在余弦评分上增加了一个小额奖励,当噪声音频嵌入朝着文本提示预测的方向漂移时,会奖励相应的类别。DAS在UrbanSound8K和FSD50K等基准数据集上展示了显著的改进,在各种噪声条件下提高了准确率和mAP得分。

  5. TOOL · CL_108737 ·

    Google Research 发布大规模声音嵌入基准,推动 AI 听觉智能发展

    Google Research 推出了大规模声音嵌入基准 (MSEB),这是一个开源平台,旨在推进 AI 听觉智能领域的发展。MSEB 标准化了八项核心声音相关能力(包括转录、分类和重建)的评估,目标是突破当前性能限制。该基准包含了多样化的数据集,例如包含超过 177,000 个语音查询的 Simple Voice Questions (SVQ) 数据集,并整合了多模态信息以模拟现实世界场景,从而促进更强大的声音理解模型的开发。