研究人员开发了KuaiRP系列角色扮演模型,专注于简化的提示工程、稳定的输出质量、整合领域知识和高效部署。为了解决在不牺牲通用能力的情况下注入领域特定知识的挑战,他们提出了一种多阶段训练流程。这包括标准化的角色模板和SFT数据流程,然后使用基于规则的奖励函数进行强化学习以防止性能下降。最后,采用一种名为累积散度衰减的两阶段按策略蒸馏的新型自蒸馏方法来恢复通用智能体能力。 AI
影响 引入了在角色扮演模型中平衡领域特定知识与通用能力的新技术。
排序理由 这是一份详细介绍新模型系列和训练方法的技术报告。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- Cumulative-Divergence Decay
- DagsHub
- Gotit.pub
- Hugging Face
- KuaiRP
- ScienceCast
- Two-stage On-Policy Distillation
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →