supertonic
PulseAugur coverage of supertonic — every cluster mentioning supertonic across labs, papers, and developer communities, ranked by signal.
-
CPU TTS 评测:Pocket TTS 表现出平坦的 RTF,UTMOS 在自然度方面遇到困难
一项对四种基于 CPU 的文本转语音 (TTS) 模型——Kokoro、Supertonic、Inflect-Nano 和 Pocket TTS——的评测显示出不同的性能特征。Pocket TTS 采用流式语言模型架构,无论输入长度如何,其实时因子 (RTF) 保持一致,使其在交互式系统中具有可预测性。然而,UTMOS 评分指标显示出局限性,未能区分清晰但机械的输出和真正自然的语音,特别是对于 Inflect-Nano 等小型语音编码器。
-
Kyutai 的 Pocket TTS 提供基于 CPU 的语音克隆,仅需 5 秒音频
Kyutai 发布了 Pocket TTS,这是一个约 1 亿参数的流式语言模型,可自回归地生成音频令牌。该模型最值得注意的是,它能够从仅 5 秒的音频中进行零样本语音克隆,这是 Kokoro、Supertonic 和 Inflect-Nano 等其他 CPU 友好型模型所不具备的功能。虽然 Pocket TTS 是测试模型中最慢的,但它提供了在 CPU 上进行语音克隆的能力,而无需 GPU,使其成为交互式应用的独特选择。
-
AI 聊天机器人集成文本转语音功能,搭载 Qwen3 模型
一个名为 AEye 的项目已在其 AI 聊天机器人中集成了文本转语音(TTS)后端,实现了语音回复。该聊天机器人利用在 llama.cpp 上运行的 Qwen3 30B A3B 模型进行文本生成。为确保流畅的音频输出,系统会缓冲初始文本并流式传输后续块,导致语音开始前有两秒延迟。
-
据报道,Supertonic 在人工智能语音生成方面超越 ElevenLabs
据 Arint.info 报道,Supertonic 的表现已超越 ElevenLabs。该初步报道未提供此次比较的具体细节和所使用的指标。