实体
Sesame CSM
Sesame CSM
PulseAugur coverage of Sesame CSM — every cluster mentioning Sesame CSM across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
-
Miso Labs 发布开放权重的 8B TTS 模型 MisoTTS
Miso Labs 发布了 MisoTTS,这是一款开放权重的 80 亿参数文本转语音模型,通过文本和音频上下文进行条件化,生成富有表现力的语音。该模型利用残差向量量化 (RVQ) 在不增加参数数量的情况下扩展其声学范围,其灵感来自 Sesame CSM 架构。与 ElevenLabs 和 Sesame 等竞争对手相比,MisoTTS 的延迟显著降低,尽管其功能和声明需要进一步的第三方验证。
-
Miso Labs 发布了 80 亿参数的文本转语音模型
Miso Labs 发布了 Miso-TTS,一个拥有 80 亿参数的文本转语音模型。该模型利用 Sesame CSM 架构,从文本和可选的音频上下文生成音频代码。它建立在一个大型的 Llama 3.2 风格骨干网络和一个较小的自回归音频解码器之上,能够实现高质量的对话语音和语音续写。
-
MisoLabs发布Miso TTS 8B用于对话语音生成
MisoLabs发布了Miso TTS 8B,一个基于Sesame CSM架构构建的新文本转语音模型。该模型利用了Llama 3.2风格的骨干网络和一个自回归音频解码器,以生成高质量的对话语音并从音频提示中延续声音。该模型可通过其GitHub仓库进行本地使用,并在MisoLabs网站上提供演示。