PulseAugur
实时 11:53:29
实体 Qwen2-Audio

Qwen2-Audio

PulseAugur coverage of Qwen2-Audio — every cluster mentioning Qwen2-Audio across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 8
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 8
层级分布 · 90 天
主题
关系
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/1 页 · 共 10 条
  1. TOOL · CL_231338 ·

    LLM增强的对齐改进了零样本呼吸音分类

    研究人员开发了一种新颖的零样本呼吸音分类框架,通过将自监督呼吸编码器与临床术语对齐。该方法利用医学LLM从元数据生成结构化报告,为对比学习创建语义锚点。该方法结合了基于sigmoid的对比损失、编码器的原生SSL目标以及相似性感知负采样,以改善病理边界区分。在多个任务和数据集上,该框架实现了61.3%的平均零样本AUC,优于CLAP和Qwen2-Audio等现有模型,并且仅使用显著更少的数据就达到了最高的线性探测AUC。

  2. TOOL · CL_227060 ·

    新方法审计生成式音频大语言模型,发现生成式通话价值有限

    研究人员开发了一种新的方法,通过审计生成式音频大语言模型(LLMs)的生成式通话来评估它们。这种方法区分了声学证据的价值和调用生成式模型的必要性。研究发现,虽然仅有文本记录的准确性有限,但像CLAP和WavLM这样的编码器模型在无需生成式通话的情况下就能达到高准确率。在利用了文本记录和编码器证据之后,才评估生成式通话的边际价值,而新方法显示与不调用基线相比改进甚微。

  3. TOOL · CL_206114 ·

    新框架 ARENA 自动化音频语言模型的红队测试

    研究人员开发了 ARENA,一个新颖的闭环框架,用于自动化大型音频语言模型(LALMs)的红队测试。该系统解决了 LALMs 特有的安全挑战,这些模型在结合文本和音频输入时可能表现出有害行为,即使单独的文本是安全的。ARENA 使用一个在文本-音频交互数据集上训练的控制器,MD-Judge 提供奖励和反馈,最终结果由 Llama Guard 3 评估。该框架在各种 LALMs 上取得了显著成功,在 AdvBench 的目标上实现了高误…

  4. TOOL · CL_196091 ·

    新框架揭示多语言语音文本模型中的跨模态计算

    研究人员开发了一个新框架,用于分析多语言语音文本模型如何处理跨模态语言对齐。该框架应用于 SeamlessM4T 和 Qwen2-Audio 等模型,识别出语言选择性神经元,并将其分为表示和控制角色。分析显示,SeamlessM4T 在生成步方面表现出显著的依赖性专业化,跨模态共享的神经元很少,而 Qwen2-Audio 则保持了更广泛的跨模态共享和稳定的对齐。研究还发现,SeamlessM4T 中的语言控制神经元在生成后期会越来越多…

  5. TOOL · CL_171848 ·

    音频大语言模型安全通过语音语调评估,而非仅文本

    研究人员开发了一种名为PJ-Break的新方法,通过关注语音语调而非仅文本内容来评估音频大语言模型(LLM)的安全性。该方法使用六种语音语调预设,如唤醒度、权威性和语速,来测试语调的变化如何导致越狱。研究发现,仅凭音频中的情感表达比仅凭文本中的情感表达更能有效地导致越狱,影响了Qwen2-Audio和GPT-4o等模型。

  6. TOOL · CL_129077 ·

    新的强化学习方法提高了语码转换语音识别的数据效率

    研究人员开发了一种新颖的强化学习技术 RLVR,以提高语码转换自动语音识别 (ASR) 的音频语言模型的数据效率。该方法利用基于策略的组相对策略优化,并结合错误率和脚本保真度奖励来适应 Qwen2-Audio 等模型。实验表明,仅使用 10% 数据训练的 RLVR,其性能可以媲美使用完整数据集的监督微调,尤其在类型学上距离较远的语言对上表现出色,并将收益转移到人工录制的语音上。

  7. TOOL · CL_98002 ·

    新的CoAT框架通过连续思考空间增强大型音频语言模型

    研究人员开发了一个名为连续音频思考(CoAT)的新框架,旨在增强大型音频语言模型(LALMs)的能力。CoAT为这些模型配备了一个连续的潜在工作空间,用于在生成响应之前组织声学信息,使它们能够更好地利用语音细节、韵律和其他声学元素。这种方法不会增加自回归解码的成本,并且在与Qwen2-Audio、Qwen2.5-Omni-7B和Audio Flamingo等模型进行测试时,在各种音频理解和推理任务中都显示出性能提升。

  8. TOOL · CL_96206 ·

    新指标ALAS评估音频语言模型对齐情况

    研究人员开发了ALAS(自动潜在对齐分数),用于评估音频语言模型将音频帧与文本标记对齐的程度。该模型和任务无关的指标分析了大型语言模型的隐藏状态,将音频和文本表示与源自Whisper的参考进行比较。ALAS仅需要一个固定的前向传播和一个现成的ASR参考,无需训练或拟合分类器。当应用于四个开源Speech-LLM时,ALAS显示对齐深度反映了音频编码器设计和任务需求,并且可以识别出在没有真正音频基础的情况下表现良好的模型。

  9. RESEARCH · CL_82554 ·

    新方法探测和引导音频AI模型中的注意力

    研究人员开发了新的方法来理解和操纵大型音频语言模型的内部工作机制。一种名为指令引导向量的方法允许重定向模型内的时间注意力,使其能够在不重新训练的情况下专注于特定的声音事件。另一种方法使用因果干预来解析音频分离模型中的注意力动态,揭示了一个双通路文本条件机制,并催生了一种称为层选择性注意力缓存的加速方法。

  10. TOOL · CL_51255 ·

    新方法压缩语言模型的音频令牌

    研究人员开发了一种名为局部时序双向合并(LTBM)的新方法,用于压缩音频语言模型中的音频令牌。这种无需训练的方法在时序窗口内合并相似的附近音频令牌,旨在降低推理成本和内存使用量。实验表明,这种局部感知合并对于音频字幕任务特别有益,尤其是在更高的压缩率下,而全局匹配在音频理解任务中表现更好。