研究人员开发了一种名为漂移约束优化(DCO)的新微调方法,旨在提高模型在特定任务上的性能,同时最大限度地减少与原始模型的行为漂移。DCO将微调重新表述为方向选择问题,侧重于更新方向的效率,而不仅仅是变化的幅度。该方法在Qwen3-8B和Qwen3-14B模型上进行了测试,在科学推理和多语言翻译方面取得了显著改进,甚至在100多种语言的翻译中超越了专用翻译系统。 AI
影响 这种方法可以通过在不牺牲通用能力的情况下提高特定任务的性能,从而实现更强大、更多功能的AI模型。
排序理由 该集群包含一篇详细介绍微调指令模型新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →