AppWorld
PulseAugur coverage of AppWorld — every cluster mentioning AppWorld across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
新的CONTRAMEM框架提高了AI代理的记忆和成功率
研究人员开发了CONTRAMEM,这是一个旨在增强自主计算机使用代理程序化记忆的新颖框架。该系统无需训练,利用不同AI模型在任务结果上的差异来改进其记忆,区分正确的和不正确的程序步骤。CONTRAMEM在复杂任务上的成功率方面显示出显著提高,使GPT-5.5、Claude Sonnet 4.6和DeepSeek V4 Pro等模型的性能提高了一倍以上。值得注意的是,CONTRAMEM学到的程序化知识可以转移到新模型和环境中,表明其在捕…
-
多代理AI系统因通信问题失败率超过40%
一项对七个开源多代理系统1642个执行轨迹的最新分析显示,失败率显著,范围从41%到86.7%。该研究利用MAST分类法发现,约32.3%的失败源于代理间的错位,这意味着代理难以有效沟通和协调。这些沟通中断表现为推理-行动不匹配、任务脱轨以及未能寻求澄清,突显了协议问题而非代理智能本身的局限性。
-
研究人员开发 Self-Harness,使 LLM 代理能够自主改进其自身系统
一篇新研究论文介绍了一种名为“Self-Harness”的方法,该方法允许基于 LLM 的代理自主改进其自身的运行 Harness。这个迭代过程包括识别模型特定的失败模式、生成 Harness 修改以及通过回归测试验证这些更改。当应用于各种模型和基准测试时,Self-Harness 持续提高了性能,为实现自改进的 AI 代理指明了方向。
-
新研究增强了 AI 代理的记忆、推理和有根据能力
研究人员正在开发先进的方法,使 AI 代理能够有效地利用长期记忆并提高其推理能力。一种名为查询条件重用 (QCR) 的方法侧重于代理如何将过去的轨迹适应新环境,在各种基准测试中显示出成功率和令牌效率的显著提高。另一个研究领域通过使用步级自蒸馏和证据锚来指导学习,解决了深度搜索代理强化学习中奖励稀疏的问题。此外,SynWeaver 等框架旨在通过与网站特定先验知识共同合成任务和轨迹来提高代理的泛化能力,而 LoongReflect 通过…
-
新的TCPO方法改进了多轮对话中的LLM推理能力
研究人员推出了一种新颖的TCPO方法,用于大型语言模型在验证器引导下的强化学习中的轮次信用分配。该方法旨在通过关注每一轮对精炼轨迹的影响,而不是仅仅关注输出的即时质量,来改进模型从反馈中学习的方式。实验表明,TCPO在包括数学推理、代码生成和代理任务在内的各种任务上都提高了性能,在Qwen3-4B和DeepSeek-R1-Distill-Llama-8B等模型上,在Pass@8等基准测试中取得了具有竞争力或更优的结果。
-
Masked Diffusion Language Models outperform AR models for agentic RL
一篇新的研究论文介绍了掩码扩散语言模型(MDLM)作为文本世界模型在代理强化学习中优于自回归(AR)模型的替代方案。MDLM 通过利用双向锚点感知去噪,展示了增强的一致性和扎实性,即使在后者规模大得多的情况下,其性能也优于 AR 模型。该研究还提出了一个新的 GRPO 训练框架,并在各种代理骨干网络上展示了在未见过环境中的大量零样本迁移收益。
-
研究发现:模型合并在AppWorld基准测试中可媲美联合强化学习
一篇新的研究论文分析了模型合并技术在强化学习中的有效性,并将其与联合多任务训练进行了比较。研究发现,在AppWorld基准测试中,合并独立训练的Qwen3-8B模型所获得的结果与联合训练的模型在统计学上没有显著差异。这种等效性归因于专家模型的任务向量接近正交的几何结构,表明在这些条件下,特定的合并方法影响甚微。
-
LLM为API调用代理生成无环境的合成数据
研究人员开发了一种新颖的方法,用于生成合成数据来训练API调用的大型语言模型(LLM)代理,而无需完全实现的运行环境。该方法利用LLM作为即时数字世界模型,仅根据API规范生成任务并模拟API响应。所生成的合成数据在用于微调模型时已显示出显著的性能提升,为跨各种API生态系统训练代理提供了可扩展的解决方案。
-
研究发现:AI代理在重写自身记忆时准确性会下降
伊利诺伊大学厄巴纳-香槟分校(UIUC)的研究人员发表的一篇新论文表明,当AI代理的记忆由大型语言模型(LLM)自身进行整合或重写时,其准确性会显著下降。该研究测试了GPT-5.4在各种环境中的表现,发现在重复的记忆整合后,其在ARC-AGI等任务上的性能从100%下降到52.6%。论文指出了导致这种性能下降的三个关键机制:选择偏差、重写漂移以及一个反馈循环,即损坏的记忆会导致进一步的错误。研究人员建议采用一种只追加(append-o…
-
新ACCORD框架将LLM代理任务完成率提升20%
研究人员推出ACCORD,一个旨在通过使语言代理能够更好地将其动作与观察到的环境上下文对齐来提高其性能的新框架。ACCORD通过在每个动作之前主动探查缺失信息并整合代理历史中的相关上下文来解决指令不明确的问题。该方法显著提高了任务完成率,在AppWorld基准测试中,使用GPT-5-mini的完成率提高了多达20.6个百分点,并且在Claude-4.5-sonnet和Qwen3.5-27B-FP8等其他模型上也显示出收益。
-
新方法提升AI代理的可靠性和安全性
研究人员开发了新方法来提高AI代理的可靠性和安全性。一种名为TRACE的方法侧重于监控长时程代理轨迹,通过分析跨越时间上遥远动作的证据来检测恶意或意外行为。另一种方法,回顾式约束优化(RHO),利用过去的轨迹进行自我监督,并在没有外部验证的情况下改进代理对技能和工具的约束。此外,HarnessFix旨在通过分析执行跟踪并将失败映射到特定约束层进行有针对性的修补,来诊断和修复代理约束中的缺陷。
-
Hugging Face推出AI系统开放代理排行榜
Hugging Face推出了开放代理排行榜(Open Agent Leaderboard),这是一个用于评估AI代理系统性能和成本的新框架。该基准测试侧重于评估代理在不同任务和环境中的通用性,而不仅仅是底层模型的能力。该排行榜利用了包括SWE-Bench Verified和AppWorld在内的六个已建立的基准测试,在编码、客户服务和研究等领域测试代理,从而更全面地了解其在现实世界中的适用性。
-
新的HINT-SD框架提高了LLM智能体训练效率
研究人员开发了HINT-SD,一个旨在提高长时序大型语言模型(LLM)智能体训练效率和效果的新框架。该方法侧重于识别和纠正轨迹中导致任务失败的特定动作,而不是对每一个回合都应用反馈。通过利用后视分析来定位这些关键决策点,HINT-SD显著减少了训练所需的时间和计算资源,在BFCL v3和AppWorld等基准测试中的改进证明了这一点。