Spoken Language Models
PulseAugur coverage of Spoken Language Models — every cluster mentioning Spoken Language Models across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
New TELEVAL benchmark evaluates Chinese spoken language models
Researchers have introduced TELEVAL, a new benchmark designed to evaluate Spoken Language Models (SLMs) in Chinese interactive scenarios. Unlike existing benchmarks that focus on semantic correctness in structured setti…
-
新框架旨在弥合口语模型中的结构性差距
研究人员发现当前口语模型(SLMs)存在一个显著的差距,他们指出,尽管这些模型能从语音生成文本,但底层的语音和文本表示仍然对齐不佳。这种结构性差异阻碍了它们在指令遵循能力和泛化能力方面与基于文本的模型相媲美。为了解决这个问题,研究人员提出了一个新框架,旨在解耦长度不匹配问题并改善语音和文本表示之间的对应关系,该框架在各种基准测试中表现出具有竞争力的性能。
-
Lychee-FD框架通过分离声学和语义模态增强全双工SLM · 跟踪2个来源
研究人员推出Lychee-FD,一个旨在通过解决模态干扰来改进全双工口语模型(SLMs)的新型框架。该框架采用分层参数分离策略来解耦声学和语义建模,同时通过语义对齐通道维持跨模态一致性。实验表明,Lychee-FD在Spoken QA和FullDuplexBench 1.5等基准测试中显著提高了语音智能和交互流畅性,且不牺牲推理效率。
-
新研究探索多模态和稀疏自编码器方法以对抗大型语言模型越狱
研究人员正在开发新的方法来对抗对语音语言模型(SLM)的越狱攻击。一种方法 JAMA 使用联合多模态优化框架同时攻击音频和文本模态,证明比单模态攻击更有效。另一项研究提出使用稀疏自编码器(SAE)进行大型语言模型越狱缓解,证明在稀疏 SAE 特征空间中进行引导比在密集激活空间中进行防御具有优势。