PulseAugur
实时 11:24:46
实体 supertonic

supertonic

PulseAugur coverage of supertonic — every cluster mentioning supertonic across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 4 条
  1. TOOL · CL_127886 ·

    CPU TTS 评测:Pocket TTS 表现出平坦的 RTF,UTMOS 在自然度方面遇到困难

    一项对四种基于 CPU 的文本转语音 (TTS) 模型——Kokoro、Supertonic、Inflect-Nano 和 Pocket TTS——的评测显示出不同的性能特征。Pocket TTS 采用流式语言模型架构,无论输入长度如何,其实时因子 (RTF) 保持一致,使其在交互式系统中具有可预测性。然而,UTMOS 评分指标显示出局限性,未能区分清晰但机械的输出和真正自然的语音,特别是对于 Inflect-Nano 等小型语音编码器。

  2. TOOL · CL_127764 ·

    Kyutai 的 Pocket TTS 提供基于 CPU 的语音克隆,仅需 5 秒音频

    Kyutai 发布了 Pocket TTS,这是一个约 1 亿参数的流式语言模型,可自回归地生成音频令牌。该模型最值得注意的是,它能够从仅 5 秒的音频中进行零样本语音克隆,这是 Kokoro、Supertonic 和 Inflect-Nano 等其他 CPU 友好型模型所不具备的功能。虽然 Pocket TTS 是测试模型中最慢的,但它提供了在 CPU 上进行语音克隆的能力,而无需 GPU,使其成为交互式应用的独特选择。

  3. TOOL · CL_124376 ·

    AI 聊天机器人集成文本转语音功能,搭载 Qwen3 模型

    一个名为 AEye 的项目已在其 AI 聊天机器人中集成了文本转语音(TTS)后端,实现了语音回复。该聊天机器人利用在 llama.cpp 上运行的 Qwen3 30B A3B 模型进行文本生成。为确保流畅的音频输出,系统会缓冲初始文本并流式传输后续块,导致语音开始前有两秒延迟。

  4. COMMENTARY · CL_90007 ·

    据报道,Supertonic 在人工智能语音生成方面超越 ElevenLabs

    据 Arint.info 报道,Supertonic 的表现已超越 ElevenLabs。该初步报道未提供此次比较的具体细节和所使用的指标。