研究人员开发了SteerablePlex,一种用于提高全双工对话模型控制力的新方法。这些模型能够同时进行听和说,但在对话历史增长时,常常难以维持对话场景。为解决此问题,创建了一个新的基准SimIF-Bench,以评估指令遵循能力。SteerablePlex方法利用了Group Reward-Decoupled Normalization Policy Optimization (GDPO)训练方法,使模型能够遵循文本指令,同时保留其轮流发言的能力。这种增强的控制力使得SteerablePlex成为比现有开源模型和GPT-Realtime更可靠的用户模拟器。 AI
影响 增强了全双工模型的可控性,可能改进用户模拟和对话式AI应用。
排序理由 该集群描述了一篇介绍对话式AI模型新方法和新基准的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- gpt-realtime
- Group Reward-Decoupled Normalization Policy Optimization
- Hugging Face
- SimIF-Bench
- SteerablePlex
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →