研究人员调查了基于编解码器的文本到语音(TTS)模型中强化学习奖励与人类感知的对齐情况。他们使用带有风格、自然度和喜爱度主观奖励的 Group Relative Policy Optimization (GRPO),发现每种奖励主要改进了其特定的目标指标,表明主观预测器并非可互换的质量替代品。人类 A/B 测试显示了这些奖励不均匀的转移,而奖励差距分析表明,虽然有符号奖励差距可以预测听众的选择,但每轴校准仍然是异构的。研究还发现,Best-of-8 重新排序方法作为一项强大的人类水平基线,在感知质量方面与 GRPO 相当。 AI
影响 这项研究强调了在将 AI 生成的语音与人类偏好对齐方面所面临的挑战,表明在 TTS 模型训练中需要更细致的奖励机制。
排序理由 关于 AI 模型训练方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →