一位用户在 r/LocalLLaMA 子版块上测试了一个名为 Confucius4 的开源语音模型,使用了具有挑战性的音频样本,包括来自体育评论和采访的扭曲和高度情绪化的语音。该模型表现良好,捕捉到了西班牙语和英语评论样本中的情感细微差别和声音破裂,以及赛后采访中颤抖的语气。虽然模型在处理较长句子时略有困难,但它成功地复制了音频源的情感传递,而没有其他语音克隆工具常有的合成感。 AI
影响 展示了开源语音模型在情感保真度方面的改进,可能增强合成语音应用的真实感。
排序理由 用户使用特定基准测试开源模型。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →