PulseAugur
实时 00:02:01
English(EN) Scenema Audio Comes to ComfyUI, Runs on 8GB VRAM

Scenema Audio 集成至 ComfyUI,可在 8GB 显存上实现富有表现力的 TTS

Scenema Audio 是一款能够进行零样本语音克隆并能通过内联舞台指示来执行富有表现力语音的文本转语音模型,现已作为 ComfyUI 的自定义节点发布。此次新集成使得该模型可以在仅有 8GB 显存的系统上运行,从而提高了其自托管的可访问性。此次发布将提示格式从 XML 简化为内联括号提示,并包含十二种预设语音,但用户可能需要接受 Gemma 3 12B 模型许可并提供 HF 令牌以进行初始设置。 AI

影响 通过使先进的生成式音频工具在消费级硬件上更易于访问,增强了创意工作流程。

排序理由 将现有 AI 模型集成到流行的创意工作流程工具中。

在 r/StableDiffusion 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

Scenema Audio 集成至 ComfyUI,可在 8GB 显存上实现富有表现力的 TTS

报道来源 [1]

  1. r/StableDiffusion TIER_2 English(EN) · /u/a__side_of_fries ·

    Scenema Audio 支持 ComfyUI,可在 8GB 显存上运行

    <table> <tr><td> <a href="https://www.reddit.com/r/StableDiffusion/comments/1vgfhrp/scenema_audio_comes_to_comfyui_runs_on_8gb_vram/"> <img alt="Scenema Audio Comes to ComfyUI, Runs on 8GB VRAM" src="https://external-preview.redd.it/dDY5d3RkeGhtbGhoMfDbbs74itHS_b4Z-x5HLPmm6FqiLRj…