Reddit 的 r/StableDiffusion 社区的一位用户正在询问本地音乐生成模型的能力,特别是询问 Yue2 或类似模型是否能够执行真正的参考到音频生成。用户正在寻找能够根据输入的参考音频和用户提示生成音频的模型,并将其与 Yue2 仅提取音符和旋律的明显限制进行对比。 AI
排序理由 用户在关于特定模型能力的子版块上提出的问题,而非正式发布或公告。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →
Reddit 的 r/StableDiffusion 社区的一位用户正在询问本地音乐生成模型的能力,特别是询问 Yue2 或类似模型是否能够执行真正的参考到音频生成。用户正在寻找能够根据输入的参考音频和用户提示生成音频的模型,并将其与 Yue2 仅提取音符和旋律的明显限制进行对比。 AI
排序理由 用户在关于特定模型能力的子版块上提出的问题,而非正式发布或公告。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →
完整方法见我们的编辑标准。
<!-- SC_OFF --><div class="md"><p>Are there any models that take input audio, and then generate audio based on the context of the reference audio and the user’s input? Something like minimax h3 that is capable of true ref2va. yue2 seems to only extract the notes and melody, and t…