PulseAugur
实时 02:20:01
English(EN) Beyond Text Following: Repairable Arbitration Reversals in Audio-Language Models

音频语言模型用冲突文本覆盖清晰音频

研究人员发现音频语言模型中存在一个重大问题,即冲突的文本输入会覆盖清晰的音频证据,导致输出不正确。一项新研究显示,在五个模型中,64.1%的冲突案例中,音频信息虽然存在,但在内部仲裁过程中却被忽略了。为了解决这个问题,开发了一种名为门控音频反事实对数校正(GACL)的新解码规则,该规则在文本和音频分数之间进行插值以提高保真度,并且可以应用于视觉-文本仲裁等其他模态。 AI

影响 识别出音频语言模型中的一个关键缺陷,可能影响多模态AI开发,并促使开发更鲁棒的仲裁机制。

排序理由 该集群包含一篇研究论文,详细介绍了音频语言模型的新发现和提出的解决方案。

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →

音频语言模型用冲突文本覆盖清晰音频

报道来源 [2]

  1. arXiv cs.CL TIER_1 English(EN) · Yichen Gao, Yiqun Zhang, Zijing Wang, Yujia Li, Heng Guo, Xi Wu, Xiaocui Yang, Shi Feng, Yifei Zhang, Daling Wang ·

    超越文本跟随:音频语言模型中的可修复仲裁逆转

    arXiv:2606.05161v1 Announce Type: cross Abstract: Audio-language models (ALMs) often follow text that conflicts with audio, even when the audio evidence is clear. This raises a basic question: is the audio-supported answer unavailable, or is it represented but overridden by the c…

  2. arXiv cs.CL TIER_1 English(EN) · Daling Wang ·

    超越文本跟随:音频语言模型中的可修复仲裁逆转

    Audio-language models (ALMs) often follow text that conflicts with audio, even when the audio evidence is clear. This raises a basic question: is the audio-supported answer unavailable, or is it represented but overridden by the conflicting text? We examine this question using a …