PulseAugur
中
实时 15:23:51
实体 Large Audio-Language Models

Large Audio-Language Models

PulseAugur coverage of Large Audio-Language Models — every cluster mentioning Large Audio-Language Models across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
44
90 天内 44
发布 · 30天
0
90 天内 0
论文 · 30天
43
90 天内 43
层级分布 · 90 天
主题
关系
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/3 页 · 共 45 条
  1. TOOL · CL_289497 ·

    新的ICAP-Gate机制控制大型音频语言模型中的音频影响

    研究人员开发了一种名为ICAP-Gate的新机制,用于控制音频对大型音频语言模型(LALM)的影响。该方法解决了任务无关音频会改变模型文本推理决策的问题,而这个问题可能会被聚合准确率指标所掩盖。与标准推理相比,ICAP-Gate选择性地控制模型内的音频通路,在各种LALM和基准测试中表现出较低的影响率和答案翻转率。值得注意的是,它在保持自动语音识别性能的同时,与自洽性等方法相比,以更低的延迟提供了有竞争力的稳定性。

  2. TOOL · CL_277319 ·

    新的AnchorPrompt方法提高了音频-语言模型的鲁棒性

    研究人员开发了AnchorPrompt,一种用于提高大型音频-语言模型(LALMs)鲁棒性的新颖方法。该技术涉及训练一个插入到模型解码器中的单一提示向量块。AnchorPrompt利用跨各种音频和文本扰动的自蒸馏来增强答案一致性并减少幻觉,即使面对未见的失真也能做到。在多个LALMs和基准上的评估表明,AnchorPrompt在对干净音频性能影响最小的情况下提高了答案的一致性和准确性,同时有效处理损坏的输入。

  3. RESEARCH · CL_254605 ·

    新方法通过编码器选择和对比解码增强大型音频语言模型 · 跟踪 2 个来源

    研究人员开发了两种新方法来提高大型音频语言模型 (LALM) 的性能。第一种方法 CUES(相关性引导编码器选择)使用轻量级启发式方法,通过估计编码器的互补性(通过性能相关性)来选择最佳编码器,在 XARES-LLM 等基准测试中取得了显著的提升。第二种方法对比解码 (CD) 系统地评估了不同的 CD 策略,确定了音频感知解码和音频对比解码最为有效。该方法主要纠正与音频忽略或不确定性驱动的猜测相关的错误,其收益与模型的基线错误特征密切相关。

  4. TOOL · CL_254569 ·

    机器遗忘技术降低了音频语言模型的隐私风险

    研究人员开发并评估了几种用于语音问答大型音频语言模型(LALMs)的机器遗忘策略。这些方法包括梯度上升、任务算术和基于对齐的微调,旨在从LALMs中移除敏感信息,同时保留其核心语音理解和问答能力。实验表明,这些遗忘技术可以将隐私泄露显著降低高达80%,同时对非私有语音问答和通用语音理解任务的性能影响极小。

  5. TOOL · CL_254390 ·

    新方法增强大型音频语言模型的时间感知能力

    研究人员开发了一种新方法来提高大型音频语言模型(LALM)的时间感知能力。当前的 LALM 在精确事件定位方面存在困难,通常依赖于训练后预测时间戳,而没有明确的声学证据链接。所提出的方法通过一个帧级对齐模型来增强 LALM,该模型将查询表示与细粒度音频特征相结合。该方法在时间对齐基准测试中显示出显著的改进,并能为下游推理任务提供证据。

  6. TOOL · CL_254204 ·

    新框架增强大型音语模型中的共情对话

    研究人员推出 ER-EDF,一个旨在增强大型音语模型(LALMs)中共情对话生成的新型框架。该框架以心理学理论为基础,明确区分了情感感知和情感调节的过程。与当前 LALMs 常常模仿用户情绪不同,ER-EDF 旨在通过调节感知情绪如何影响响应生成来提供校准支持。该方法与模型无关,并在各种 LALMs 和数据集上持续提高了共情响应质量,自动和人工评估均已验证。

  7. TOOL · CL_235421 ·

    新的混合搜索方法增强了基于LLM的语音识别

    研究人员开发了一种名为混合搜索的新方法,以改进集成大型语言模型(LLM)的自动语音识别(ASR)系统。该技术利用基于LLM的ASR模型与其基础LLM之间的隐藏状态交互特征,来识别具有高度语义依赖性的词元。通过选择性地精炼这些目标词元,混合搜索在ASR性能方面超越了传统的全局纠正方法,证明了基于LLM的ASR模型可以通过利用其基础LLM来进一步提高推理时间性能。

  8. TOOL · CL_233383 ·

    新基准测试AI对听觉错觉的理解能力

    研究人员推出了AIB,这是首个旨在评估大型音频语言模型(LALMs)复制人类听觉错觉能力的基准。该基准涵盖了音乐、声音和语音中的十种不同错觉,并纳入了基于知识的先验信息。虽然目前的大型音频语言模型在较简单的错觉中倾向于忠实于原始音频信号,但一些模型在涉及语言或音乐背景时表现出更像人类的反应,尽管没有一个模型能完全匹配人类的感知。这项工作旨在为理解大型音频语言模型的认知能力提供一种新方法。

  9. TOOL · CL_231667 ·

    新的MRMAD基准揭示大型音频语言模型在音频退化感知方面存在困难

    研究人员推出了MRMAD,这是一个旨在评估大型音频语言模型(LALM)理解声学退化能力的新基准。与专注于语义理解的现有基准不同,MRMAD评估LALM在多轮对话中识别、比较和推理音频质量问题的能力。对18种不同LALM的评估显示,当前模型在可靠诊断和比较音频退化方面存在困难,与人类听众相比存在显著差距。

  10. TOOL · CL_231366 ·

    研究发现:语音增强或会阻碍阿尔茨海默病检测模型

    一篇新发表在arXiv上的研究论文对用于阿尔茨海默病检测的语音增强和数据策技术有效性提出了质疑。研究发现,虽然“更清晰”的语音数据集可以提高深度学习模型在特定领域内的性能,但它们往往会降低模型在现实场景中的鲁棒性和泛化能力。即使是大型语音语言模型也表现出类似的敏感性,这表明处理过的语音数据不一定对准确检测阿尔茨海默病更可靠。

  11. TOOL · CL_229224 ·

    新研究指出大型语音语言模型存在位置偏差

    一篇新发表在arXiv上的研究论文,探究了大型语音语言模型(LALMs)中的位置偏差。研究表明,这些模型会受到答案选项顺序的影响,导致性能波动高达24%,并改变模型排名。研究人员提出了基于排列的策略来缓解这种偏差,旨在提高LALM评估的可靠性。

  12. RESEARCH · CL_241526 ·

    新方法通过语音分析改善阿尔茨海默病检测,但数据清理可能损害泛化能力

    研究人员开发了一种名为LLM-Anchored Paralinguistic Enrichment (LAPE)的新方法,通过语音分析来改善阿尔茨海默病的检测。LAPE将语言内容与受阿尔茨海默病影响的停顿和单词延长等副语言线索相结合。该方法在ADReSS和ADReSSo数据集上进行了评估,取得了最先进的性能。另外,一项研究重新审视了现有的基于语音的阿尔茨海默病检测基准,发现虽然语音增强可以提高模型在特定领域内的性能,但可能会降低深度学…

  13. RESEARCH · CL_226735 ·

    新模型应对音频时间戳和时序约束语言理解

    一篇新研究论文介绍了TEMPO,一种新颖的大型音频语言模型(LALM),能够为音频事件分配精确的时间戳,这是许多当前LALM所缺乏的功能。TEMPO采用独特的监督微调方法,结合原子时间戳标记和时序感知投影仪,并通过强化学习进一步优化。另外,一个名为Sori-1B的新音频时序约束语言模型已从头开始开发,其重点在于仅通过音频配对文本来约束语言理解,而不是依赖纯文本预训练。

  14. RESEARCH · CL_227219 ·

    新的基准和方法解决了跨模态和跨领域的 LLM 幻觉问题

    研究人员正在开发新的方法和基准,以检测和减轻各种模态和领域的 LLM(大语言模型)中的幻觉。OmniHallu 为检测多模态理解和生成任务中的幻觉提供了一个统一的框架,并得到了新基准的支持。另一种方法侧重于特定领域的幻觉检测,结合分类、不确定性量化和偏好优化,以减少 Qwen2.5 等模型中的错误。对于法律应用,LexAgentHallu 被引入为一个基准,用于分析工具增强型法律代理中的幻觉,并突出代理的失败。此外,证据对齐实体验证 …

  15. TOOL · CL_212061 ·

    大型音频语言模型音频令牌压缩技术探索

    研究人员开发了压缩大型音频语言模型(LALMs)音频令牌序列的方法,解决了当前音频编码器的高计算成本问题。探索了无监督分割和平均池化等技术,并结合低秩适配器进行微调,以在大型语言模型处理之前减少音频令牌的数量。这些压缩后的LALMs在自动语音识别和语音到语音翻译任务上,在实现输入音频令牌数量减少高达三倍的同时,表现出与帧级模型相当的性能。

  16. TOOL · CL_206182 ·

    新框架利用编辑判断对齐音频大语言模型以实现章节划分

    研究人员开发了AudioChaps,一个用于对齐音频大语言模型(LALMs)以执行音频章节划分任务的训练后框架。该框架利用组相对策略优化(GRPO)和思维链(CoT)推理来改进LALMs将连续音频流分割成主题连贯章节的方式。为此,精心整理了三个新数据集——AudioChaps-Alignment、AudioChaps-CoT和AudioChaps-Eval,其中后者用作基准。使用此框架训练的AudioChaps-R1模型在章节划分任务…

  17. TOOL · CL_206114 ·

    新框架 ARENA 自动化音频语言模型的红队测试

    研究人员开发了 ARENA,一个新颖的闭环框架,用于自动化大型音频语言模型(LALMs)的红队测试。该系统解决了 LALMs 特有的安全挑战,这些模型在结合文本和音频输入时可能表现出有害行为,即使单独的文本是安全的。ARENA 使用一个在文本-音频交互数据集上训练的控制器,MD-Judge 提供奖励和反馈,最终结果由 Llama Guard 3 评估。该框架在各种 LALMs 上取得了显著成功,在 AdvBench 的目标上实现了高误…

  18. TOOL · CL_203930 ·

    新框架衡量音频语言模型的公平性

    研究人员开发了一个新框架来评估大型音频语言模型(LALMs)的公平性。这种语义感知的混合效应回归方法通过考虑内容中的语义变化和特定说话者的特征,解决了语音输入设置中的挑战。通过使用 LALM 本身的句子级语义嵌入,该方法旨在提供更稳健、更易于解释的亚组性能差异估计,减少虚假的公平性发现。

  19. RESEARCH · CL_193702 ·

    AI模型的情感神经元已跨语言识别和验证

    研究人员对大型音频语言模型(LALMs)进行了首次神经元级别可解释性研究,以了解它们如何在不同语言中编码情感。研究在Qwen2.5 Omni、Kimi-Audio和Audio Flamingo 3等模型中识别出了“多语言情感神经元”(MLENs)和“情感敏感神经元”(ESNs)。因果干预表明,当操纵这些特定神经元时,可以精确控制或降低模型识别和生成情感的能力,展示了语言特定和可跨语言迁移的情感能力。

  20. RESEARCH · CL_193542 ·

    新研究通过概率和低频输入分析应对LLM和LALM安全风险 · 已追踪2个来源

    研究人员引入了ProbGuard,一种利用早期输出分布信号来增强大型语言模型(LLM)安全性的新颖概率方法。该方法旨在通过估计持续不安全输出的概率来检测和缓解不安全生成,显著提高了校准性能并降低了攻击成功率。另外,一种名为间歇性低频锁定(ILL)的新红队测试方法已被开发出来,用于识别大型音频语言模型(LALM)中由听不见的低频输入带来的安全风险。ILL显示出模型准确率的显著下降,促使开发了分布查询保护(DRG)来检测这些变化并实现语义恢复。