研究人员开发了BENCH2ROBUST,一个旨在评估和改进使用工具的大型语言模型(LLM)代理鲁棒性的新框架。该框架将现有基准转换为模拟真实世界工具故障的随机环境,要求代理在面对错误时学习重试、切换工具或放弃的策略。使用BENCH2ROBUST进行的实验表明,将贝叶斯工具内存(BTM)与强化学习相结合,可以显著提高代理在工具故障条件下的性能,无需重新训练即可将鲁棒性提高多达16.8个百分点,并在模拟零售任务中达到40.8%-45.5%的成功率。 AI
影响 通过解决工具故障问题,增强了LLM代理在现实场景中的可靠性,有望改善用户体验和任务完成率。
排序理由 该集群描述了一篇关于LLM代理鲁棒性改进的新研究论文,其中包含一个新颖的框架和实验结果。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →