Scenema Audio 是一款能够进行零样本语音克隆并能通过内联舞台指示来执行富有表现力语音的文本转语音模型,现已作为 ComfyUI 的自定义节点发布。此次新集成使得该模型可以在仅有 8GB 显存的系统上运行,从而提高了其自托管的可访问性。此次发布将提示格式从 XML 简化为内联括号提示,并包含十二种预设语音,但用户可能需要接受 Gemma 3 12B 模型许可并提供 HF 令牌以进行初始设置。 AI
影响 通过使先进的生成式音频工具在消费级硬件上更易于访问,增强了创意工作流程。
排序理由 将现有 AI 模型集成到流行的创意工作流程工具中。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →