PulseAugur
实时 09:31:10
实体 Pocket TTS

Pocket TTS

PulseAugur coverage of Pocket TTS — every cluster mentioning Pocket TTS across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 5
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
时间线
  1. 2026-07-06 product_launch Kyutai released Pocket TTS, a new text-to-speech model capable of voice cloning from short audio samples. 来源
  2. 2026-07-06 product_launch Kyutai released Pocket TTS, a new CPU-based text-to-speech model capable of zero-shot voice cloning. 来源
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 5 条
  1. RESEARCH · CL_199292 ·

    CPU 语音克隆基准测试:Pocket TTS、Kokoro、Audio8、XTTS v2 对比

    一项实际基准测试在 CPU 性能上评估了四种语音克隆模型(Pocket TTS、Kokoro、Audio88 & Yassin 和 XTTS v2)。评估重点关注说话人相似度、自然度、清晰度和延迟,使用了具有不同说话人和口音的 VCTK 数据集。研究发现,虽然 XTTS v2 和 Audio88 & Yassin 是真正的零样本克隆模型,但 Kokoro 在自然度方面表现更好,而 Pocket TTS 和 Kokoro 可作为 CPU…

  2. TOOL · CL_196480 ·

    Llama.cpp 通过 Pocket-TTS 集成增加了设备端文本转语音功能

    Llama.cpp 项目集成了 Pocket-TTS,实现了设备端文本转语音生成,无需云服务。此次集成允许直接从已支持大型语言模型的仓库进行本地语音合成。此外,GLM 5.2 的定价降低了 20%。

  3. TOOL · CL_127886 ·

    CPU TTS 评测:Pocket TTS 表现出平坦的 RTF,UTMOS 在自然度方面遇到困难

    一项对四种基于 CPU 的文本转语音 (TTS) 模型——Kokoro、Supertonic、Inflect-Nano 和 Pocket TTS——的评测显示出不同的性能特征。Pocket TTS 采用流式语言模型架构,无论输入长度如何,其实时因子 (RTF) 保持一致,使其在交互式系统中具有可预测性。然而,UTMOS 评分指标显示出局限性,未能区分清晰但机械的输出和真正自然的语音,特别是对于 Inflect-Nano 等小型语音编码器。

  4. TOOL · CL_127764 ·

    Kyutai 的 Pocket TTS 提供基于 CPU 的语音克隆,仅需 5 秒音频

    Kyutai 发布了 Pocket TTS,这是一个约 1 亿参数的流式语言模型,可自回归地生成音频令牌。该模型最值得注意的是,它能够从仅 5 秒的音频中进行零样本语音克隆,这是 Kokoro、Supertonic 和 Inflect-Nano 等其他 CPU 友好型模型所不具备的功能。虽然 Pocket TTS 是测试模型中最慢的,但它提供了在 CPU 上进行语音克隆的能力,而无需 GPU,使其成为交互式应用的独特选择。

  5. TOOL · CL_116438 ·

    用户寻求帮助实现Calm TTS论文,面临语音克隆问题

    一位用户正在寻求有关实现研究论文中描述的Calm文本到语音模型的帮助。他们在复制模型性能方面遇到了困难,在生成有意义的文本和实现准确的语音克隆方面遇到了问题。用户尝试了各种技术,包括计划采样和调整数据条件,但面临诸如梯度爆炸以及文本质量与语音保真度之间的权衡等挑战。他们正在寻求关于如何进行的建议,是重新审视论文、增加数据集大小,还是解决潜在的系统设计缺陷。