PulseAugur
实时 08:37:46
English(EN) Living-Harness Is an Interactive-Agent Evolver

Living-Harness 系统通过自我进化提高 LLM 代理的可靠性 · 已追踪 2 个来源

研究人员开发了 Living-Harness,这是一个旨在提高大型语言模型 (LLM) 代理可靠性的新颖系统。与使用固定参数的静态工具不同,Living-Harness 根据过去的交互和评估信号动态更新其程序化知识。这种自我进化机制提取片段抽象和结构化更新证据,创建片段记忆和状态图来指导未来的行动。该系统在 tau^2-BenchMultiWOZ-2.4 等基准测试中,平均 Pass@1 提高了 10 个百分点以上,表现出显著的性能提升。 AI

影响 这种自我进化的工具方法可能导致在交互环境中更强大、更可靠的 LLM 代理。

排序理由 该集群包含一篇详细介绍改进 LLM 代理新方法的论文。

在 arXiv cs.MA (Multiagent) 阅读 →

AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →

Living-Harness 系统通过自我进化提高 LLM 代理的可靠性 · 已追踪 2 个来源

报道来源 [2]

  1. arXiv cs.CL TIER_1 English(EN) · Yuetian Du, Yucheng Wang, He Xu, Jiexu Xu, Shanwen Tan, Bing Zhao, Boyu Yang, Zhijie Xu, Ming Kong, Hu Wei, Jie Liu, Qiang Zhu ·

    Living-Harness 是一个交互式智能体进化器

    arXiv:2607.26598v1 Announce Type: cross Abstract: Large language model (LLM) agents may recover from a failure within an episode or after a retry, yet the same execution failure can recur in later tasks because post-episode feedback rarely revises the persistent harness that guid…

  2. arXiv cs.MA (Multiagent) TIER_1 English(EN) · Qiang Zhu ·

    Living-Harness 是一个交互式代理进化器

    Large language model (LLM) agents may recover from a failure within an episode or after a retry, yet the same execution failure can recur in later tasks because post-episode feedback rarely revises the persistent harness that guides future interactions. Static harnesses improve r…