研究人员开发了一种新方法来提高大型音频语言模型(LALM)的时间感知能力。当前的 LALM 在精确事件定位方面存在困难,通常依赖于训练后预测时间戳,而没有明确的声学证据链接。所提出的方法通过一个帧级对齐模型来增强 LALM,该模型将查询表示与细粒度音频特征相结合。该方法在时间对齐基准测试中显示出显著的改进,并能为下游推理任务提供证据。 AI
影响 增强音频模型中细粒度时间事件的定位,可能改进需要精确计时的应用。
排序理由 该集群包含一篇详细介绍改进人工智能模型能力新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX Code Finder for Papers
- Connected Papers
- CORE Recommender
- DagsHub
- Gotit.pub
- Hugging Face
- Influence Flower
- Large Audio-Language Models
- Litmaps
- ScienceCast
- scite Smart Citations
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →