研究人员在代理语言模型的多教师同策略蒸馏中发现了一个“行为杠杆失衡”问题。这种失衡会导致模型过度调用工具,即使在直接回答更合适的情况下也是如此,而这个问题无法通过聚合损失指标来检测。为了解决这个问题,提出了一种名为Soft Clamp的新方法,该方法对每令牌发散进行校准以减轻极端信号。实验表明,Soft Clamp显著减少了过度调用,并提高了APIGen-MT等基准测试的决策准确性。 AI
影响 这项研究可能有助于开发更可靠的代理语言模型,使其能更好地理解何时使用工具以及何时提供直接答案。
排序理由 该集群包含一篇详细介绍新AI模型训练方法的学术论文。
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →