Voicebox
PulseAugur coverage of Voicebox — every cluster mentioning Voicebox across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
AI工具组合用于创作动画短片
一位Reddit用户分享了一个为孩子创作的10分钟动画短片,使用了StableDiffusion生成视觉内容。该项目包括由Claude生成的剧本,在Davinci中组装,配乐来自Suno,语音由Voicebox辅助。尽管承认存在一些不完美之处,但由于孩子积极的反应,创作者认为这部短片是成功的。
-
AI地图和开源Whispr模型在Mastodon上被重点介绍
两条独立的Mastodon帖子重点介绍了不同的AI相关项目。第一条分享了一个托管在Artifipedia上的AI资源交互式地图链接。第二条帖子指向Whispr的GitHub存储库,Whispr是一个开源的、支持免费套餐的语音模型,它利用Cloudflare AI。
-
Voicebox:开源 AI 语音工作室提供本地优先的替代方案
Voicebox,一个新发布的开源 AI 语音工作室,作为 ElevenLabs 和 WisprFlow 等商业服务的本地优先替代方案。该工具允许用户从简短的音频样本中克隆声音,使用各种 TTS 引擎以多种语言生成语音,并使用 Whisper 转录音频。Voicebox 完全在用户计算机上运行,通过不将录音发送到云端来确保隐私,并且还可以与 AI 代理集成。
-
新框架 CORTIS 实现 TTS 模型持续说话人遗忘
研究人员开发了一个名为累积正交身份抑制(CORTIS)的新框架,以应对从零样本文本到语音(ZS-TTS)模型中持续遗忘说话人身份的挑战。现有方法在遗忘请求顺序进行时会失效,因为它们可能会恢复先前已被遗忘的说话人。然而,CORTIS 使用基于费舍尔信息参数掩码和正交投影的方法,确保一旦说话人身份被遗忘,即使在后续遗忘请求中也不会被重新记起,并且无需访问先前遗忘的数据。该方法在 VoiceBox 模型上被证明是有效的,其性能优于先前方法的顺序应用。