SpeechLLMs
PulseAugur coverage of SpeechLLMs — every cluster mentioning SpeechLLMs across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
语音大语言模型解码器显示出显著的冗余,允许进行层剪枝
研究人员调查了语音大语言模型(SpeechLLMs)解码器层的冗余度,这些层通常占模型参数的90%以上。他们对不同模型规模的研究表明,在不显著影响自动语音识别(ASR)性能的情况下,可以剪枝相当一部分解码器层。研究结果表明,即使是70亿至80亿参数的模型,在只有60%的解码器层完好的情况下也能保持良好的ASR能力,这一趋势在不同规模和任务(包括语音翻译)中都有观察到。
-
FBK 的 SpeechLLMs 在 IWSLT 2026 指令遵循任务中取得优异成绩
FBK 研究人员为 IWSLT 2026 指令遵循共享任务开发了 SpeechLLMs,重点关注短篇幅和长篇幅语音指令遵循。对于短篇幅任务,他们的模型取得了 2.0708 的 SIFS 分数。在长篇幅任务中,他们探索了各种分段方法,并引入了 HIFS 分数来评估性能,发现固定的 30 秒分段产生了最佳结果,得分为 2.0663。分析表明,长篇幅生成中的幻觉主要涉及重复插入,尽管短篇幅能力基本保持不变。
-
研究发现:语音大语言模型对东欧口音存在偏见
一项新的研究论文量化了语音大语言模型(SpeechLLMs)中的交叉偏见。该研究使用了跨越六种英语口音和两种性别表现的2880次受控交互,并采用语音克隆技术来保持语言内容的一致性。结果表明,带有东欧口音的语音,特别是来自女性声音的语音,在有用性得分上较低,但礼貌性保持一致。虽然大语言模型评估者检测到了这些偏见,但人类评估者对基于口音的差异表现出更高的敏感度。
-
新方法利用仅解码器LLM增强同步语音翻译
研究人员正在开发新的同步语音翻译方法,重点关注仅解码器的大型语言模型。一种名为AlignAtt4LLM的方法,通过调整这些模型的注意力机制来提高德语和意大利语等语言的翻译质量,即使在低延迟场景下也是如此。另一种名为DOA的方法,在SpeechLLMs内部使用自注意力机制,在无需重新训练的情况下获得长文本翻译的对齐信号。此外,一个名为Canary的系统,拥有10亿参数,提供了多种语言的离线同步翻译能力。
-
新研究揭示领域自适应SpeechLLM中的隐私风险
一篇新发表在arXiv上的研究论文详细介绍了一种领域自适应自动语音识别(ASR)模型(通常称为SpeechLLM)中存在的重大隐私风险。研究表明,当这些模型通过敏感信息的提示或专有数据的微调进行特定领域定制时,它们可能会无意中转录其上下文或训练数据中语音上相似的词语,即使实际说出的词语不同。这种泄露可能暴露私人信息。研究人员开发了一个数据集来量化不同定制方法下的风险,发现结合提示和微调会加剧该问题。他们还评估了一种提示级别的缓解策略,…
-
SpeechLLMs在翻译基准测试中表现参差不齐,级联系统仍占主导地位
一项新的综合测试套件“Hearing to Translate”已被开发出来,用于评估将语音模态直接集成到大型语言模型(LLMs)中进行语音到文本翻译的有效性。该研究将六个最先进的SpeechLLMs与十六个级联系统进行了基准测试,分析了在16个基准、13种语言对和9种挑战性条件下的性能。研究结果表明,虽然级联系统总体上仍然最可靠,但最近的SpeechLLMs在特定场景下可以与之匹敌甚至超越它们,而独立的Speech Foundati…