研究人员开发了Looped Audio Spectrogram Transformer (LAST),这是一种旨在提高音频识别效率的新型transformer模型。LAST首先处理所有音频token,然后使用相同的计算块迭代地优化仅有的类别token,显著减少了后续迭代中对额外参数和操作的需求。这种方法在AudioSet等基准测试中取得了优越的性能,以更少的参数和更高的吞吐量超越了传统的顺序transformer,同时在各种声音分类任务中也展现出更强的鲁棒性和泛化能力。 AI
影响 为音频处理引入了更高效的transformer架构,有望提高音频识别任务的性能并降低计算成本。
排序理由 详细介绍新模型架构的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →