PulseAugur
实时 10:29:05
English(EN) Retry, Switch, or Abstain? Learning Strategy-Aware Tool-Use Policies via Controlled Error Injection

新框架测试LLM代理工具使用的鲁棒性以应对故障

研究人员开发了BENCH2ROBUST,一个旨在评估和改进使用工具的大型语言模型(LLM)代理鲁棒性的新框架。该框架将现有基准转换为模拟真实世界工具故障的随机环境,要求代理在面对错误时学习重试、切换工具或放弃的策略。使用BENCH2ROBUST进行的实验表明,将贝叶斯工具内存(BTM)与强化学习相结合,可以显著提高代理在工具故障条件下的性能,无需重新训练即可将鲁棒性提高多达16.8个百分点,并在模拟零售任务中达到40.8%-45.5%的成功率。 AI

影响 通过解决工具故障问题,增强了LLM代理在现实场景中的可靠性,有望改善用户体验和任务完成率。

排序理由 该集群描述了一篇关于LLM代理鲁棒性改进的新研究论文,其中包含一个新颖的框架和实验结果。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新框架测试LLM代理工具使用的鲁棒性以应对故障

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Chaoran Chen, Vy Nguyen, Ziji Zhang, Abhinav Gullapalli, Ziyi Wang, Yuxuan Lu, Dakuo Wang, Jing Huang, Zhou Yu, Jin Lai ·

    重试、切换还是弃权?通过受控错误注入学习策略感知工具使用策略

    arXiv:2608.11977v1 Announce Type: new Abstract: Tool-using LLM agents are commonly trained and evaluated in environments where tool calls succeed reliably, yet deployed tools can fail transiently, persistently, or silently. Robust recovery therefore requires more than repeated re…