PulseAugur
实时 08:01:26
实体 Qwen2-Audio

Qwen2-Audio

PulseAugur coverage of Qwen2-Audio — every cluster mentioning Qwen2-Audio across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 6
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 6 条
  1. TOOL · CL_171848 ·

    音频大语言模型安全通过语音语调评估,而非仅文本

    研究人员开发了一种名为PJ-Break的新方法,通过关注语音语调而非仅文本内容来评估音频大语言模型(LLM)的安全性。该方法使用六种语音语调预设,如唤醒度、权威性和语速,来测试语调的变化如何导致越狱。研究发现,仅凭音频中的情感表达比仅凭文本中的情感表达更能有效地导致越狱,影响了Qwen2-Audio和GPT-4o等模型。

  2. TOOL · CL_129077 ·

    新的强化学习方法提高了语码转换语音识别的数据效率

    研究人员开发了一种新颖的强化学习技术 RLVR,以提高语码转换自动语音识别 (ASR) 的音频语言模型的数据效率。该方法利用基于策略的组相对策略优化,并结合错误率和脚本保真度奖励来适应 Qwen2-Audio 等模型。实验表明,仅使用 10% 数据训练的 RLVR,其性能可以媲美使用完整数据集的监督微调,尤其在类型学上距离较远的语言对上表现出色,并将收益转移到人工录制的语音上。

  3. TOOL · CL_98002 ·

    新的CoAT框架通过连续思考空间增强大型音频语言模型

    研究人员开发了一个名为连续音频思考(CoAT)的新框架,旨在增强大型音频语言模型(LALMs)的能力。CoAT为这些模型配备了一个连续的潜在工作空间,用于在生成响应之前组织声学信息,使它们能够更好地利用语音细节、韵律和其他声学元素。这种方法不会增加自回归解码的成本,并且在与Qwen2-Audio、Qwen2.5-Omni-7B和Audio Flamingo等模型进行测试时,在各种音频理解和推理任务中都显示出性能提升。

  4. TOOL · CL_96206 ·

    新指标ALAS评估音频语言模型对齐情况

    研究人员开发了ALAS(自动潜在对齐分数),用于评估音频语言模型将音频帧与文本标记对齐的程度。该模型和任务无关的指标分析了大型语言模型的隐藏状态,将音频和文本表示与源自Whisper的参考进行比较。ALAS仅需要一个固定的前向传播和一个现成的ASR参考,无需训练或拟合分类器。当应用于四个开源Speech-LLM时,ALAS显示对齐深度反映了音频编码器设计和任务需求,并且可以识别出在没有真正音频基础的情况下表现良好的模型。

  5. RESEARCH · CL_82554 ·

    新方法探测和引导音频AI模型中的注意力

    研究人员开发了新的方法来理解和操纵大型音频语言模型的内部工作机制。一种名为指令引导向量的方法允许重定向模型内的时间注意力,使其能够在不重新训练的情况下专注于特定的声音事件。另一种方法使用因果干预来解析音频分离模型中的注意力动态,揭示了一个双通路文本条件机制,并催生了一种称为层选择性注意力缓存的加速方法。

  6. TOOL · CL_51255 ·

    新方法压缩语言模型的音频令牌

    研究人员开发了一种名为局部时序双向合并(LTBM)的新方法,用于压缩音频语言模型中的音频令牌。这种无需训练的方法在时序窗口内合并相似的附近音频令牌,旨在降低推理成本和内存使用量。实验表明,这种局部感知合并对于音频字幕任务特别有益,尤其是在更高的压缩率下,而全局匹配在音频理解任务中表现更好。