研究人员开发了 Living-Harness,这是一个旨在提高大型语言模型 (LLM) 代理可靠性的新颖系统。与使用固定参数的静态工具不同,Living-Harness 根据过去的交互和评估信号动态更新其程序化知识。这种自我进化机制提取片段抽象和结构化更新证据,创建片段记忆和状态图来指导未来的行动。该系统在 tau^2-Bench 和 MultiWOZ-2.4 等基准测试中,平均 Pass@1 提高了 10 个百分点以上,表现出显著的性能提升。 AI
影响 这种自我进化的工具方法可能导致在交互环境中更强大、更可靠的 LLM 代理。
排序理由 该集群包含一篇详细介绍改进 LLM 代理新方法的论文。
在 arXiv cs.MA (Multiagent) 阅读 →
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →