实体
Audio-LLM
Audio-LLM
PulseAugur coverage of Audio-LLM — every cluster mentioning Audio-LLM across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
新探测方法揭示音频语言模型为何忽略韵律
一篇新的研究论文介绍了一种方法,用于查明音频语言模型(audio-LLMs)未能利用韵律信息的原因,韵律信息除了口语中的词语之外,还能传达情感和语言的细微差别。该研究提出了一种特定阶段的探测梯队,以确定失败是由于声学信息丢失、内部解释不正确,还是由于可用内部表示的表达不足。对四个音频语言模型的实验显示,虽然韵律信息通常在模型的后期状态下得以保留和解码,但并未在最终输出中充分表达,这表明模型在使用而非感知这些信息方面存在瓶颈。
-
新的MERaLiON-GR模型在多种语言上实现了最先进的性别识别
研究人员开发了MERaLiON-GR,这是一种新颖的语音性别识别模型,能够对英语和多种东南亚语言的性别进行分类。该模型基于MERaLiON-SpeechEncoder-2(一种基于Conformer的Transformer)构建,并利用低秩自适应(LoRA)进行高效微调。在包括中文、马来语、泰米尔语、泰语、越南语、印度尼西亚语和高棉语在内的各种评估模式和语言中,MERaLiON-GR的表现优于Vox-Profile和大型Audio-L…