研究人员开发了一种优化大型语言模型(LLM)用于动机性访谈(一种治疗技术)的方法。通过在AnnoMI语料库的数据上使用直接偏好优化(DPO),他们训练模型来平衡“目标坚持性”(GP)和“关系协调性”(RA)。研究发现,惩罚对抗性能够可靠地降低Qwen和Llama等不同LLM家族的目标坚持性,而关系协调性的提升则不一致。惩罚屈服几乎没有效果,因为模型在策略内很少表现出这种行为。 AI
影响 这项研究通过提高LLM在引导用户实现目标的同时保持融洽关系的能力,可能带来更有效的AI驱动的治疗工具。
排序理由 该集群包含一篇学术论文,详细介绍了一种优化LLM用于特定应用的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
- Direct Preference Optimization
- Goal Persistence
- Llama
- Miti
- motivational interviewing
- Qwen
- Relational Attunement
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →