Webshop
PulseAugur coverage of Webshop — every cluster mentioning Webshop across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
新的BehR方法改进了基于文本的世界模型以实现代理行为
研究人员引入了一种名为行为一致性奖励(BehR)的新训练范式,以改进基于文本的世界模型。与侧重于单步状态预测的传统方法不同,BehR通过衡量日志记录动作的可能性来优化世界模型与真实环境之间的功能一致性。在WebShop和TextWorld上的实验表明,基于BehR的训练增强了长期对齐,并减少了离线评估中的假阳性,同时在推理时间规划方面也显示出适度的收益。
-
新的AUSO方法优化AI代理技能,从指导到利用
研究人员引入了AUSO(动作级统一技能优化),一种新颖的AI代理训练方法,它将技能从外部指导逐步整合到内部决策知识中。该方法旨在改进代理在其策略演变过程中学习和利用技能的方式。AUSO在训练早期联合学习教师指导和环境结果,然后转向基于结果的优化,最后根据有技能条件和无技能条件的上下文评估动作,以完善技能利用。在ALFWorld、WebShop和SearchQA基准上的实验表明,AUSO增强了代理的性能和泛化能力。
-
新方法通过引导式探索提升 Agentic 强化学习
两篇新的研究论文介绍了增强 Agentic 强化学习的创新方法,解决了复杂、长时程任务中奖励稀疏的挑战。Agent-G$^2$ 提出了一个高斯引导框架,用于估计探索的最佳轨迹深度范围,其性能优于现有方法,且滚动成本显著降低。另一方面,EDGE 专注于将检索到的经验的好处直接提炼到参数策略中,使智能体能够在没有外部指导的情况下内化探索模式并保持性能。
-
新研究解决了长时序任务中LLM智能体的信用分配问题 · 已追踪2个来源
两篇新研究论文探讨了改进大型语言模型(LLM)智能体信用分配的方法,特别是在成功信号稀疏的长时序任务中。第一篇论文《无真实标签的信用分配》(Credit Without Ground Truth)在ALFWorld中根据因果真实标签审计了现有的信用信号,发现它们表现不佳,常常反映模型流畅性而非实际贡献。第二篇论文《TRCA:逐转换评分信用分配》(TRCA: Transition-wise Rubric Credit Assignmen…
-
新型MELLON大语言模型通过多模态输入提高网页导航准确性
研究人员开发了MELLON(一种用于在线导航的多模态增强大语言模型),旨在提高网页导航代理的性能。这种新方法侧重于对文本和图像输入的对齐,增强了多模态推理和规划能力。在WebShop基准测试中,MELLON在单个训练周期后任务完成准确率提高了9.26%,凸显了多模态策略在更有效的网页导航方面的潜力。
-
新框架利用LLM的内部情感来改进智能体技能选择
研究人员开发了Emotion2Skill,一个利用大型语言模型(LLM)内部情感信号来增强基于技能的智能体性能的新颖框架。该方法从LLM的残差流中提取27维情感向量,并将其整合到智能体的决策过程中,用于技能选择和演化。通过分析情感轨迹,Emotion2Skill可以识别和纠正存在问题的技能调用,从而显著提高任务成功率。在WebShop和ALFWorld基准测试中使用Qwen3-8B和Qwen3-14B模型进行测试时,Emotion2S…
-
新的MemWM模型通过增强记忆来提升AI规划能力
研究人员开发了MemWM,一种新颖的增强记忆的文本世界模型,旨在通过解决系统性预测错误来改进规划代理。MemWM包含一个精心策划的过渡规则、状态缓存和关键事实的记忆库,以条件化下一状态的想象。评估表明,这种记忆增强显著提高了规划代理的事实状态保持能力和下游任务成功率,在结构化状态保真度方面提高了206.3%,在规划任务中相对提高了65.4%。
-
新研究解决 LLM 代理的信用分配问题 · 已追踪 2 个来源
arXiv 上的两篇新研究论文探讨了大型语言模型代理的高级信用分配技术。第一篇论文《从推理到代理:大型语言模型强化学习中的信用分配》综合了现有研究,以应对在复杂的代理环境中确定哪些具体行动或推理步骤能带来预期结果的挑战。第二篇论文《Gated-BEPO:置信门控贝尔曼信用分配用于大型语言模型代理》引入了一种名为 Gated-BEPO 的新方法,该方法使用经验性滚动图和置信门来更有效地将稀疏终端结果的奖励传播到单个行动,并在各种基准测试…
-
新的SMRC-SD方法增强了多轮AI代理的性能
研究人员开发了一种名为状态匹配路由和上下文自蒸馏(SMRC-SD)的新方法,以改进多轮AI代理。该技术解决了当代理的行动导致其进入未被参考指导覆盖的状态时发生的状态-参考不匹配问题。SMRC-SD将蒸馏限制在仅匹配的状态,并构建了状态条件化的教师上下文,从而带来了显著的性能提升。当应用于Qwen3-1.7B模型时,SMRC-SD在ALFWorld上的任务成功率从0.746提升到0.865,在WebShop上的任务成功率从0.574提升…
-
新的蒸馏方法FTB通过验证教师指导来提高智能体性能
研究人员开发了一种名为FutureBridge-OPD (FTB) 的新方法,以改进智能体任务的策略内蒸馏 (OPD)。标准的OPD在教师访问的状态上监督学生,但学生的偏差可能导致随时间的指导效果不佳。FTB通过观察学生的后续轨迹来评估在高分歧状态下教师指导的好处,从而解决这个问题。在ALFWorld、WebShop和ScienceWorld上的实验中,FTB在现有方法上显示出显著的性能提升,当使用Qwen3-32B作为Qwen3-1…
-
新的AI学习方法SKL侧重于状态预测知识
研究人员推出了一种名为状态知识学习(SKL)的新方法,旨在改进AI代理从经验中学习的方式。与目前依赖轨迹级别反思的方法不同,SKL侧重于维护明确的、声明式的预测评估,这些评估与特定状态相关联。这种方法旨在为AI代理提供更精细、更具泛化性且可自举的知识。在WebShop和ScienceWorld等环境以及ChessPuzzles等复杂推理任务上的实验表明,SKL的性能显著优于现有的基于反思的训练范式。
-
MemHarness框架使LLM代理能够重构过往经历
研究人员推出了一种名为MemHarness的新型框架,旨在通过使大型语言模型(LLM)代理能够重构过往经历而非简单回放,来增强其能力。这种受人类记忆启发的做法允许代理将检索到的信息适应当前情境,从而避免负面迁移并改善决策。在ALFWorld和WebShop上的实验表明,MemHarness在出分布场景下显著优于现有的强化学习和静态记忆增强基线。
-
新的STAPO框架通过减少轨迹忽略来改进LLM代理训练
研究人员开发了STAPO(选择性轨迹感知策略优化),一个新颖的层次强化学习框架,旨在改进大型语言模型(LLM)代理的训练。STAPO解决了“轨迹忽略”问题,即代理因稀疏或延迟的奖励而失去对任务目标的关注。通过利用新颖的“归一化熵”指标,STAPO识别并优化与被忽略轨迹相关的异常步骤,增强了代理的意识和训练稳定性。在ALFWorld、WebShop和Search-Augmented QA基准上的实验表明,STAPO取得了最先进的性能,并…
-
研究发现:AI代理在重写自身记忆时准确性会下降
伊利诺伊大学厄巴纳-香槟分校(UIUC)的研究人员发表的一篇新论文表明,当AI代理的记忆由大型语言模型(LLM)自身进行整合或重写时,其准确性会显著下降。该研究测试了GPT-5.4在各种环境中的表现,发现在重复的记忆整合后,其在ARC-AGI等任务上的性能从100%下降到52.6%。论文指出了导致这种性能下降的三个关键机制:选择偏差、重写漂移以及一个反馈循环,即损坏的记忆会导致进一步的错误。研究人员建议采用一种只追加(append-o…
-
新研究解决了AI智能体弃权问题
一篇新研究论文介绍了“智能体弃权”(Agentic Abstention),解决了AI智能体知道何时停止与环境交互,而不是在不确定性下继续行动的挑战。该研究在超过28,000个任务中评估了13个LLM作为智能体(LLM-as-agent)的系统和2个智能体脚手架(agent scaffolds),发现许多智能体在及时弃权方面存在困难,要么在应该停止时从不停止,要么不必要地继续。为了改善这一点,研究人员开发了CONVOLVE,一种上下文…
-
新研究探索用于智能体生存、导航和可解释性的高级强化学习 · 跟踪 7 个来源
研究人员正在探索强化学习(RL)的高级技术,以增强智能体的性能和可解释性。一项研究提出了程序化策略(PERL)作为进化 RL 中神经策略(NERL)的替代方案,证明了 PERL 更高的生存率。另一篇论文侧重于使用 RL 进行自主机器人的流感知导航,发现使用速度和记忆传感器训练的智能体优于那些具有显式全局流参数的智能体。此外,正在开发新的方法来解释 RL 智能体,例如使用归纳逻辑编程(ILP)为策略可解释性创建客观指标,以及一种称为 S…
-
新方法通过分解不确定性来增强 LLM 智能体的澄清寻求能力
研究人员开发了一种新颖的方法,使 LLM 智能体能够通过分解不确定性来提高其寻求澄清的能力。该方法将行动置信度与请求不确定性分开,使智能体能够在任务规范模糊时主动寻求澄清。该方法在新基准上进行了评估,与现有技术相比,在多个 LLM 主干上澄清 F1 分数有了显著提高。
-
新的强化学习方法增强大型语言模型训练的稳定性和效率 · 跟踪 7 个来源
研究人员开发了几种新方法来提高大型语言模型 (LLM) 中强化学习 (RL) 的稳定性和效率。STARE 通过根据惊奇度重新加权 token 级优势来解决策略熵崩溃问题,在推理基准测试中显示出更高的准确性。GrowthHacker 利用 LLM 代理自主优化离策略评估 (OPE) 代码,证明了改进 OPE 系统的可行性。ZPPO 将教师模型保留在提示中而不是策略梯度中,从而增强了小型学生模型的知识蒸馏。GD$^2$PO 通过过滤掉具有…
-
新的HERO框架通过事后反馈增强AI代理学习
研究人员推出了一种新颖的强化学习代理框架HERO,旨在改进多轮决策。与依赖最终结果的传统方法不同,HERO使用事后增强的自我蒸馏,并将下一个环境观察作为局部反馈。这种方法将每次观察转换为一个紧凑的轮次级诊断,为代理的行为提供可操作的见解。HERO在TauBench和WebShop等基准测试中,尤其是在成功部署不频繁的有限训练预算下,已证明了任务成功率的提高和不必要轮次的减少。
-
AI代理跨多个环境使用单一重排序器
研究人员开发了一种方法,可以在多个基于文本的代理环境中训练单一的神经网络重排序器来执行动作选择,从而降低推理成本。通过在ALFWorld、WebShop和ScienceWorld上联合训练DeBERTa-v3模型,他们取得了显著的性能提升,并展示了积极的跨领域迁移能力。这种方法具有高度的样本效率,只需极少的微调数据即可恢复可观的性能,并表明数据多样性比模型容量对于跨环境适应更重要。