研究人员开发了一种名为“ours”的新方法,以提高AI代理的工具使用能力,特别是在处理误导性历史数据时。该方法使用一个能够访问“Oracle”状态的教师策略来训练学生模型,从而有效地指导学生模型即使在面对损坏或过时信息时也能做出正确的决策。在Qwen3-1.7B模型上的实验表明,“ours”的性能显著优于现有方法,达到了87.0%的平衡工具使用准确率,并且随着模型规模的增大表现出持续的可扩展性。 AI
影响 增强了AI代理在复杂、多轮交互中的可靠性,可能提高需要顺序决策的应用的性能。
排序理由 关于改进AI工具使用新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Gold-SFT
- Hugging Face
- off-policy token distillation
- Oracle sequence distillation
- ours
- Qwen3 1.7B
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →