PulseAugur
实时 08:39:56
实体 Large Audio-Language Models

Large Audio-Language Models

PulseAugur coverage of Large Audio-Language Models — every cluster mentioning Large Audio-Language Models across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
7
90 天内 31
发布 · 30天
0
90 天内 0
论文 · 30天
7
90 天内 30
层级分布 · 90 天
主题
关系
情绪 · 30 天

6 天有情绪数据

最近 · 第 1/2 页 · 共 31 条
  1. TOOL · CL_212061 ·

    大型音频语言模型音频令牌压缩技术探索

    研究人员开发了压缩大型音频语言模型(LALMs)音频令牌序列的方法,解决了当前音频编码器的高计算成本问题。探索了无监督分割和平均池化等技术,并结合低秩适配器进行微调,以在大型语言模型处理之前减少音频令牌的数量。这些压缩后的LALMs在自动语音识别和语音到语音翻译任务上,在实现输入音频令牌数量减少高达三倍的同时,表现出与帧级模型相当的性能。

  2. TOOL · CL_206182 ·

    新框架利用编辑判断对齐音频大语言模型以实现章节划分

    研究人员开发了AudioChaps,一个用于对齐音频大语言模型(LALMs)以执行音频章节划分任务的训练后框架。该框架利用组相对策略优化(GRPO)和思维链(CoT)推理来改进LALMs将连续音频流分割成主题连贯章节的方式。为此,精心整理了三个新数据集——AudioChaps-Alignment、AudioChaps-CoT和AudioChaps-Eval,其中后者用作基准。使用此框架训练的AudioChaps-R1模型在章节划分任务…

  3. TOOL · CL_206114 ·

    新框架 ARENA 自动化音频语言模型的红队测试

    研究人员开发了 ARENA,一个新颖的闭环框架,用于自动化大型音频语言模型(LALMs)的红队测试。该系统解决了 LALMs 特有的安全挑战,这些模型在结合文本和音频输入时可能表现出有害行为,即使单独的文本是安全的。ARENA 使用一个在文本-音频交互数据集上训练的控制器,MD-Judge 提供奖励和反馈,最终结果由 Llama Guard 3 评估。该框架在各种 LALMs 上取得了显著成功,在 AdvBench 的目标上实现了高误…

  4. TOOL · CL_203930 ·

    新框架衡量音频语言模型的公平性

    研究人员开发了一个新框架来评估大型音频语言模型(LALMs)的公平性。这种语义感知的混合效应回归方法通过考虑内容中的语义变化和特定说话者的特征,解决了语音输入设置中的挑战。通过使用 LALM 本身的句子级语义嵌入,该方法旨在提供更稳健、更易于解释的亚组性能差异估计,减少虚假的公平性发现。

  5. RESEARCH · CL_193702 ·

    AI模型的情感神经元已跨语言识别和验证

    研究人员对大型音频语言模型(LALMs)进行了首次神经元级别可解释性研究,以了解它们如何在不同语言中编码情感。研究在Qwen2.5 Omni、Kimi-Audio和Audio Flamingo 3等模型中识别出了“多语言情感神经元”(MLENs)和“情感敏感神经元”(ESNs)。因果干预表明,当操纵这些特定神经元时,可以精确控制或降低模型识别和生成情感的能力,展示了语言特定和可跨语言迁移的情感能力。

  6. RESEARCH · CL_193542 ·

    新研究通过概率和低频输入分析应对LLM和LALM安全风险 · 已追踪2个来源

    研究人员引入了ProbGuard,一种利用早期输出分布信号来增强大型语言模型(LLM)安全性的新颖概率方法。该方法旨在通过估计持续不安全输出的概率来检测和缓解不安全生成,显著提高了校准性能并降低了攻击成功率。另外,一种名为间歇性低频锁定(ILL)的新红队测试方法已被开发出来,用于识别大型音频语言模型(LALM)中由听不见的低频输入带来的安全风险。ILL显示出模型准确率的显著下降,促使开发了分布查询保护(DRG)来检测这些变化并实现语义恢复。

  7. RESEARCH · CL_185168 ·

    HyPASE框架使用双曲几何进行高效LALM微调

    研究人员开发了HyPASE,一个利用双曲几何进行参数高效微调大型音频语言模型(LALMs)以用于语音情感识别(SER)的新型框架。与在欧几里得空间中操作的传统方法不同,HyPASE采用了Poincaré球模型来更好地捕捉情感线索的多粒度性。该框架包括一个双曲几何适配器(HGA)和一个情感感知多容量跨模态聚合器(EMCA),它们共同提高了在MELD和IEMOCAP等基准测试上的性能,尤其是在类别不平衡数据集上。这种方法为将LALMs适应…

  8. TOOL · CL_154369 ·

    ESCUCHA基准发布,用于LALM中的西班牙语语音理解

    研究人员推出了ESCUCHA,这是一个旨在专门评估西班牙语大型音频语言模型(LALM)的新基准。该基准解决了在现实的、异构的声学条件下评估LALM的不足之处,并包含了各种西班牙语口音和非标准语音。ESCUCHA包含1000个由人工策划的问题,音频总时长超过160小时,强调跨类别推理能力,并包含多音频问题和口语指令等复杂音频格式。对最先进模型的初步基准测试表明,与人类能力相比存在显著的性能差距。

  9. RESEARCH · CL_147765 ·

    大型音频语言模型在语音身份验证系统中展现潜力

    研究人员探索了大型音频语言模型(LALM)在欺骗感知说话人验证(SASV)中的应用,这是语音身份验证系统面对高级文本到语音和语音克隆威胁的关键领域。虽然LALM在生成自然语言解释方面显示出潜力,但它们在SASV的零样本设置下的表现目前接近随机水平。然而,特定任务的适应性显著提高了它们的能力,实现了具有竞争力的SASV性能,并将LALM定位为统一且可审计的说话人验证系统的有希望的基础。

  10. RESEARCH · CL_141512 ·

    新研究解决音频语言模型在指令遵循和评估方面的局限性

    研究人员正在开发新方法来改进大型音频语言模型(LALM)的功能。一种方法侧重于使用音频感知LLM为文本到音频生成中的指令遵循提供细粒度反馈,特别是在涉及多个声音事件和时间顺序的任务中。另一项研究调查了LALM在语音评估中可能采取的潜在捷径,发现一些模型依赖于协议级别的线索,而不是真正地收听音频。此外,还引入了新的基准和模型来评估和增强长音频录音中的多音频理解和时间定位能力。

  11. RESEARCH · CL_141385 ·

    新研究利用先进的AI技术解决音频深度伪造检测问题

    研究人员正在开发先进的音频深度伪造检测方法,重点是提高泛化能力和可解释性。一种名为SONAR的方法利用频率引导框架来利用合成音频中的高频伪影,取得了最先进的性能。另一种方法采用维纳-霍普夫线性预测结合轻量级CNN,创建了一个可解释的检测系统,该系统在较低的复杂性下保持了具有竞争力的准确性。此外,一个使用大型音频语言模型的受人类启发的推理框架旨在为深度伪造分类提供更具可解释性的理由,而其他研究则调查了检测模型中的性别偏见,并提出了结合空…

  12. TOOL · CL_128909 ·

    新流程 Auto-AEG 提升了 LALM 的音频事件定位能力

    研究人员开发了 Auto-AEG,这是一个可扩展的流程,旨在为开放词汇音频事件定位构建监督数据。该任务旨在在音频中精确定位由自然语言查询描述的声音事件,这是当前大型音频语言模型 (LALM) 所缺乏的能力。Auto-AEG 通过结合具有精确时间标注的合成音频片段和来自真实世界音频的伪标签来解决数据稀缺问题,从而能够进行微调以提高在 DESED SED 和 AEGBench 等基准测试上的性能。

  13. RESEARCH · CL_129126 ·

    新的VIBE框架揭示了大型音频语言模型中的系统性偏见

    一个名为VIBE的新框架已被开发出来,用于通过真实语音和开放式任务来评估大型音频语言模型(LALMs)中的偏见。与依赖合成语音或多项选择题的先前方法不同,VIBE允许偏见自然出现,从而提供更全面的公平性视图。使用VIBE对12个领先的LALMs进行的评估揭示了系统性偏见,特别是在响应性别和口音线索时,偏见的严重程度高度依赖于特定任务。

  14. TOOL · CL_121484 ·

    新方法通过自适应变换提高音频语言模型的准确性

    研究人员开发了一种名为自适应扰动选择(APS)的新方法,以提高大型音频语言模型(LALMs)的准确性。现有的对比解码技术通常使用掩码或噪声等粗略方法,但APS探索了更广泛的音频变换范围。通过测试各种时间域、频谱域、频率域和幅度域的扰动,研究发现最优变换是任务特定的。例如,音频反转将时间顺序准确性从74.7%提高到81.4%。一个在模型状态上训练的轻量级选择器通过动态路由负分支进一步提高了性能,在存在任务上额外增加了4.3%的增益。

  15. TOOL · CL_119468 ·

    ALM2Vec框架使用大型音频语言模型进行通用音频检索

    研究人员推出了一种新颖的框架ALM2Vec,旨在通过利用大型音频语言模型(LALMs)来创建通用音频嵌入。与以往专注于音频-字幕匹配的方法不同,ALM2Vec旨在支持更广泛的检索目标和可控行为。该框架转移了LALMs的能力,实现了面向指令的检索,用于音频问答和面向方面检索等任务。实验表明,ALM2Vec在标准基准测试中表现具有竞争力,同时展示了在不同领域和用户意图中统一音频嵌入的潜力。

  16. TOOL · CL_109873 ·

    新基准评估音频大语言模型上下文感知场景理解能力

    研究人员推出了一项名为CASU(上下文感知听觉场景理解)的新基准,用于评估大型音频语言模型(LALMs)。现有基准通常孤立地评估语音或声音等音频层,未能捕捉这些元素在真实听觉场景中的交互方式。CASU基准旨在衡量LALM整合语音、事件和背景噪音等各种声音层以理解整体场景并推理它们之间关系的能力。使用此基准进行的实验表明,有效的听觉场景理解需要跨所有声音层的整合,这凸显了CASU在推进LALM复杂音频理解方面的必要性。

  17. TOOL · CL_113484 ·

    新基准显示 LALM 裁判在副语言评估方面落后于人类

    研究人员开发了 ParaPairAudioBench,这是一个旨在评估大型音频语言模型 (LALM) 在区分语音中细微副语言特征能力的新基准。该基准包含 5,175 个音频对,涵盖五个维度:风格、语速、强调、年龄和性别。目前的 LALM 裁判表现明显不如人类评估,平均落后 32 个百分点,并且在校准方面存在困难,尤其是在正确判断应弃权时。

  18. TOOL · CL_98002 ·

    新的CoAT框架通过连续思考空间增强大型音频语言模型

    研究人员开发了一个名为连续音频思考(CoAT)的新框架,旨在增强大型音频语言模型(LALMs)的能力。CoAT为这些模型配备了一个连续的潜在工作空间,用于在生成响应之前组织声学信息,使它们能够更好地利用语音细节、韵律和其他声学元素。这种方法不会增加自回归解码的成本,并且在与Qwen2-Audio、Qwen2.5-Omni-7B和Audio Flamingo等模型进行测试时,在各种音频理解和推理任务中都显示出性能提升。

  19. RESEARCH · CL_96198 ·

    新基准应对大型语言模型的隐私风险

    研究人员开发了新的方法来评估针对大型语言模型(LLM)的成员推理攻击(MIA),特别关注音频和文本模态。第一项研究引入了一种系统性的评估方法,用于大型音频语言模型(LALM),使用“多模态盲基线”来控制分布偏移,揭示了记忆是跨模态的,并且与说话人的声音身份有关。第二篇论文CheckMIABench提出了一种基于中间训练检查点和公共数据进行LLM原则性MIA评估的框架,展示了其在Pythia和OLMo模型上的应用,并发布了一个模块化库以…

  20. RESEARCH · CL_90823 ·

    新的AudioDER数据集提升LALM推理能力

    研究人员推出了AudioDER,一个旨在增强大型音频语言模型(LALMs)推理能力的新数据集。该数据集通过去重过程提高多样性,解决了现有音频语言数据集中冗余的问题。AudioDER包含约191,000个样本,每个样本包括一个音频片段、一个多项选择题、答案选项、一个音频字幕以及由Qwen3-30B生成的思维链推理过程。实验表明,在AudioDER上对Qwen2-Audio-7B-Instruct等LALMs进行预训练后,在各种音频推理基…