PulseAugur
中
实时 12:20:22
实体 Pocket TTS

Pocket TTS

PulseAugur coverage of Pocket TTS — every cluster mentioning Pocket TTS across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
6
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
时间线
  1. 2026-07-06 product_launch Kyutai released Pocket TTS, a new text-to-speech model capable of voice cloning from short audio samples. 来源
  2. 2026-07-06 product_launch Kyutai released Pocket TTS, a new CPU-based text-to-speech model capable of zero-shot voice cloning. 来源
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 6 条
  1. TOOL · CL_248289 ·

    本地 GPT Live 克隆在 RTX 3060 上运行,使用 Qwen3.5 9B 模型

    一位用户成功创建了一个 GPT Live 语音助手的本地克隆版本,该版本可以在配备 12GB 显存的消费级 NVIDIA GeForce RTX 3060 显卡上运行。该设置使用了 Qwen3.5 9B 模型进行语言处理,Qwen3 1.7B 进行语音识别,以及 Pocket TTS 进行语音输出。该本地版本与 OpenAI "Improved Intelligence" 演示中使用的相同提示进行了测试,在不到六分半钟的时间内完成了任…

  2. RESEARCH · CL_199292 ·

    CPU 语音克隆基准测试:Pocket TTS、Kokoro、Audio8、XTTS v2 对比

    一项实际基准测试在 CPU 性能上评估了四种语音克隆模型(Pocket TTS、Kokoro、Audio88 & Yassin 和 XTTS v2)。评估重点关注说话人相似度、自然度、清晰度和延迟,使用了具有不同说话人和口音的 VCTK 数据集。研究发现,虽然 XTTS v2 和 Audio88 & Yassin 是真正的零样本克隆模型,但 Kokoro 在自然度方面表现更好,而 Pocket TTS 和 Kokoro 可作为 CPU…

  3. TOOL · CL_196480 ·

    Llama.cpp 通过 Pocket-TTS 集成增加了设备端文本转语音功能

    Llama.cpp 项目集成了 Pocket-TTS,实现了设备端文本转语音生成,无需云服务。此次集成允许直接从已支持大型语言模型的仓库进行本地语音合成。此外,GLM 5.2 的定价降低了 20%。

  4. TOOL · CL_127886 ·

    CPU TTS 评测:Pocket TTS 表现出平坦的 RTF,UTMOS 在自然度方面遇到困难

    一项对四种基于 CPU 的文本转语音 (TTS) 模型——Kokoro、Supertonic、Inflect-Nano 和 Pocket TTS——的评测显示出不同的性能特征。Pocket TTS 采用流式语言模型架构,无论输入长度如何,其实时因子 (RTF) 保持一致,使其在交互式系统中具有可预测性。然而,UTMOS 评分指标显示出局限性,未能区分清晰但机械的输出和真正自然的语音,特别是对于 Inflect-Nano 等小型语音编码器。

  5. TOOL · CL_127764 ·

    Kyutai 的 Pocket TTS 提供基于 CPU 的语音克隆,仅需 5 秒音频

    Kyutai 发布了 Pocket TTS,这是一个约 1 亿参数的流式语言模型,可自回归地生成音频令牌。该模型最值得注意的是,它能够从仅 5 秒的音频中进行零样本语音克隆,这是 Kokoro、Supertonic 和 Inflect-Nano 等其他 CPU 友好型模型所不具备的功能。虽然 Pocket TTS 是测试模型中最慢的,但它提供了在 CPU 上进行语音克隆的能力,而无需 GPU,使其成为交互式应用的独特选择。

  6. TOOL · CL_116438 ·

    用户寻求帮助实现Calm TTS论文,面临语音克隆问题

    一位用户正在寻求有关实现研究论文中描述的Calm文本到语音模型的帮助。他们在复制模型性能方面遇到了困难,在生成有意义的文本和实现准确的语音克隆方面遇到了问题。用户尝试了各种技术,包括计划采样和调整数据条件,但面临诸如梯度爆炸以及文本质量与语音保真度之间的权衡等挑战。他们正在寻求关于如何进行的建议,是重新审视论文、增加数据集大小,还是解决潜在的系统设计缺陷。