实体
GLM-4-Voice
GLM-4-Voice
PulseAugur coverage of GLM-4-Voice — every cluster mentioning GLM-4-Voice across labs, papers, and developer communities, ranked by signal.
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天
2 天有情绪数据
最近 · 第 1/1 页 · 共 3 条
-
GLM-4-Voice 使用 RL 实现最先进的口语数学推理
研究人员已将强化学习应用于 GLM-4-Voice 语音模型,以提高其数学推理能力。在对口语问答数据进行监督微调后,该模型在 GSM8K 基准测试上的准确性有所提高,在不增加额外推理 token 的情况下,超越了之前的语音模型性能。通过集成流式推理技术进一步增强了性能,在数学任务中,语音原生模型的准确率达到了新的最先进水平 74.8%。
-
新研究致力于提升多语言AI的效率和能力
研究人员正在开发新方法来提高多语言AI模型的效率和能力。一项研究探索了用于多语言语音识别的令牌合并技术,表明该技术可以在不同语言和模型规模下,以极小的准确性影响显著降低计算成本。另一篇论文介绍了CVSS-X,一个大型合成语音到语音翻译语料库,将翻译能力扩展到28种语言。此外,还提出了一个名为DunDun的新指标,用于评估文本到语音系统中的词汇音调,特别是对于像约鲁巴语这样的声调语言,以及一个用于多语言LLM的模块化框架,旨在通过使用特…
-
BayLing-Duplex 使单个 LLM 能够实现原生全双工语音对话
研究人员开发了 BayLing-Duplex,这是一种新颖的全双工语音语言模型,无需依赖外部轮流模块即可实现同时听和说。这个单一的自回归 LLM 可以处理自然的对话现象,如打断和犹豫。通过一个适度的数据集进行微调,BayLing-Duplex 在轮流和打断处理方面表现出很高的成功率,同时与基于轮流的模型相比,保持或提高了响应质量。