PulseAugur
实时 08:20:50
实体 AudioSet

AudioSet

PulseAugur coverage of AudioSet — every cluster mentioning AudioSet across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 7
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 6
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 7 条
  1. TOOL · CL_218007 ·

    音频优先分类可削减自我中心视频字幕的VLM调用

    研究人员开发了一种新颖的音频优先方法,用于高效字幕化长视频。该方法优先考虑音频线索,以决定哪些视频片段对视觉语言模型(VLM)的分析最相关,从而降低计算成本。通过训练系统每行动触发一次,而不是每帧触发一次,与现有的基于视觉特征或均匀采样的方法相比,该技术显著提高了行动覆盖率并减少了VLM调用,即使使用冻结的音频特征也是如此。

  2. TOOL · CL_203992 ·

    新的BAT系统使用LLM进行空间声音推理

    研究人员开发了BAT,一个结合了双耳声景分析模型和大型语言模型(LLM)以实现空间声音推理的系统。为此,他们通过合成AudioSet和SoundSpaces 2.0的空间音频创建了一个新数据集,并开发了SpatialSoundQA,一个用于空间声音感知的问答数据集。该系统的声学前端,即空间音频频谱Transformer(Spatial-AST),在声音事件检测、定位和距离估计方面表现出色。当与LLaMA-2 7B模型集成时,BAT在空…

  3. TOOL · CL_151853 ·

    AV-JEPA 模型推进视听自监督学习

    研究人员推出了 AV-JEPA,这是一种新的自监督学习模型,它将 LeJEPA 扩展到处理音频和视觉数据。该模型利用早期融合的 Vision Transformer 和模态 dropout 进行掩码,旨在对齐全局视图和局部视图的嵌入。AV-JEPA 在 VGGSound 和 AudioSet 等数据集上取得了出色的分类性能,并提供了开箱即用的零样本视听检索功能,无需复杂的组件,如解码器或对比负样本。

  4. RESEARCH · CL_147479 ·

    研究人员比较Token表征与CNN在鸟类发声检测中的应用

    来自DS@GT ARC的研究人员在BirdCLEF+ 2026挑战赛中,探索了Token表征与监督式CNN骨干网络的对比,该挑战赛侧重于在声景中检测动物发声。他们开发了一个基线模型,在私有排行榜上取得了0.936的得分。该研究还调查了基于Token的表征(如来自神经音频编解码器和基础嵌入的表征)是否能与传统的CNN方法相媲美,并将专业的生物声学模型与在AudioSet上训练的Token编码器进行了比较。

  5. TOOL · CL_123983 ·

    kandinskylab发布KVAE-Audio,一款高保真音频自编码器

    kandinskylab发布了KVAE-Audio,一款新的连续全频带音频自编码器。该模型能有效地将原始音频波形压缩成紧凑的潜在表示,并以高保真度重建语音、音乐和通用声音。它被设计用作生成模型的潜在空间,内部测试表明,当KVAE-Audio集成到流程中时,文本到音频生成质量有所提高。

  6. TOOL · CL_63017 ·

    新探测方法提升音频SSL模型评估效果

    研究人员开发了一种名为二值化原型探测的新方法,用于评估音频自监督学习模型。该技术解决了现有方法中全局池化造成的_信息瓶颈_,这种瓶颈可能错误地表示嵌入质量并阻碍在局部音频任务上的性能。新的探测方法能更有效地聚合_token_信息,其性能优于传统的线性探测和注意力探测方法,并对_state-of-the-art_结果所需的计算密集型_fine-tuning_的必要性提出了挑战。

  7. RESEARCH · CL_22176 ·

    新的无监督方法分割音频中的多语言笑声

    研究人员开发了一种新的无监督方法,用于分割多种语言的声学笑声。该方法将笑声检测视为音频序列上的异常检测问题,利用带有 BYOL-A 编码器表示的 Isolation Forest 算法。与通常偏向英语数据集的现有最先进算法相比,该方法在非英语语境中表现出更优越的性能。