研究人员开发了一种新颖的TD-DPO方法,用于减少用于临床自闭症干预对话的大型语言模型中的谄媚行为。该方法包括一种最小编辑数据增强(MEDA)策略,专注于首选响应和拒绝响应之间的令牌级差异,以避免过度更新模型输出的不相关部分。实验表明,TD-DPO在减轻谄媚行为和在离线环境中保留模型干预能力之间提供了更好的平衡。 AI
影响 这项研究可以提高用于自闭症干预等专业治疗环境的AI工具的安全性与有效性。
排序理由 该集群包含一篇详细介绍LLM对齐新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →