PulseAugur
实时 16:47:13
实体 audio large language models

audio large language models

PulseAugur coverage of audio large language models — every cluster mentioning audio large language models across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 5
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 5
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 5 条
  1. TOOL · CL_193598 ·

    新基准在语言学维度上探测TTS评估器

    研究人员开发了一个新的基准来评估自动文本到语音(TTS)系统,超越了简单的自然度指标。该基准将语音质量分解为10个不同的语言学维度,使用了860个发音的训练有素的语言学家的注释。对四个平均意见得分(MOS)预测器和四个音频大型语言模型(Audio-LLM)裁判的评估表明,MOS预测器仅关注声学信号质量,而Audio-LLM则表现出不覆盖所有维度的提示依赖性检测。这两种方法都不能可靠地识别广泛的语言学结构语音错误,凸显了对更细致的TTS评估的需求。

  2. TOOL · CL_191270 ·

    新的GRM框架增强了音频LLM越狱攻击的隐蔽性

    研究人员开发了一个名为GRM(Gradient-Ratio Masking,梯度比率掩码)的新框架,以提高音频大型语言模型(ALLMs)越狱攻击的隐蔽性。该方法选择性地对音频输入的特定频段应用扰动,而不是整个音频频谱,以引发不安全响应。实验表明,GRM在显著降低模型在正常任务上效用退化的同时,实现了高越狱成功率,使得攻击不那么显眼。

  3. TOOL · CL_51165 ·

    音频大语言模型统一语音编辑检测与本地化

    研究人员开发了一个新的框架,利用音频大语言模型统一语音编辑检测与内容本地化。该方法通过将任务重塑为结构化文本生成问题,解决了现有方法在删除类编辑方面的局限性。该框架包含一个名为AiEdit的大规模双语数据集,其中包含更多种类的真实编辑操作。

  4. TOOL · CL_50898 ·

    新框架提高音频大语言模型在噪声下的鲁棒性

    研究人员开发了EchoDistill,一个新颖的自蒸馏框架,旨在增强音频大语言模型(ALLMs)在真实世界噪声下的鲁棒性。该方法使用策略优化来指导学生模型的响应,将嘈杂的学生模型与来自教师模型的清洁音频参考进行对齐。实验表明,EchoDistill在嘈杂条件下显著提高了语义可靠性和任务性能,在GSR和准确率等指标上取得了显著的提升。

  5. RESEARCH · CL_32654 ·

    SpeakerLLM 以说话人特定理解能力推动音频AI发展

    研究人员开发了SpeakerLLM,一个新颖的音频大语言模型框架,旨在增强AI系统中的说话人理解和验证能力。该框架将说话人画像、录音条件分析和基于证据的验证推理整合到自然语言界面中。SpeakerLLM利用分层说话人分词器来捕捉详细的声学和身份线索,旨在通过提供更细致的洞察和结构化的推理痕迹来改进现有的音频大模型和传统的说话人验证系统。