Webshop
PulseAugur coverage of Webshop — every cluster mentioning Webshop across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
新的STAPO框架通过减少轨迹忽略来改进LLM代理训练
研究人员开发了STAPO(选择性轨迹感知策略优化),一个新颖的层次强化学习框架,旨在改进大型语言模型(LLM)代理的训练。STAPO解决了“轨迹忽略”问题,即代理因稀疏或延迟的奖励而失去对任务目标的关注。通过利用新颖的“归一化熵”指标,STAPO识别并优化与被忽略轨迹相关的异常步骤,增强了代理的意识和训练稳定性。在ALFWorld、WebShop和Search-Augmented QA基准上的实验表明,STAPO取得了最先进的性能,并…
-
研究发现:AI代理在重写自身记忆时准确性会下降
伊利诺伊大学厄巴纳-香槟分校(UIUC)的研究人员发表的一篇新论文表明,当AI代理的记忆由大型语言模型(LLM)自身进行整合或重写时,其准确性会显著下降。该研究测试了GPT-5.4在各种环境中的表现,发现在重复的记忆整合后,其在ARC-AGI等任务上的性能从100%下降到52.6%。论文指出了导致这种性能下降的三个关键机制:选择偏差、重写漂移以及一个反馈循环,即损坏的记忆会导致进一步的错误。研究人员建议采用一种只追加(append-o…
-
新研究解决了AI智能体弃权问题
一篇新研究论文介绍了“智能体弃权”(Agentic Abstention),解决了AI智能体知道何时停止与环境交互,而不是在不确定性下继续行动的挑战。该研究在超过28,000个任务中评估了13个LLM作为智能体(LLM-as-agent)的系统和2个智能体脚手架(agent scaffolds),发现许多智能体在及时弃权方面存在困难,要么在应该停止时从不停止,要么不必要地继续。为了改善这一点,研究人员开发了CONVOLVE,一种上下文…
-
新研究探索用于智能体生存、导航和可解释性的高级强化学习 · 跟踪 7 个来源
研究人员正在探索强化学习(RL)的高级技术,以增强智能体的性能和可解释性。一项研究提出了程序化策略(PERL)作为进化 RL 中神经策略(NERL)的替代方案,证明了 PERL 更高的生存率。另一篇论文侧重于使用 RL 进行自主机器人的流感知导航,发现使用速度和记忆传感器训练的智能体优于那些具有显式全局流参数的智能体。此外,正在开发新的方法来解释 RL 智能体,例如使用归纳逻辑编程(ILP)为策略可解释性创建客观指标,以及一种称为 S…
-
新方法通过分解不确定性来增强 LLM 智能体的澄清寻求能力
研究人员开发了一种新颖的方法,使 LLM 智能体能够通过分解不确定性来提高其寻求澄清的能力。该方法将行动置信度与请求不确定性分开,使智能体能够在任务规范模糊时主动寻求澄清。该方法在新基准上进行了评估,与现有技术相比,在多个 LLM 主干上澄清 F1 分数有了显著提高。
-
新的强化学习方法增强大型语言模型训练的稳定性和效率 · 跟踪 7 个来源
研究人员开发了几种新方法来提高大型语言模型 (LLM) 中强化学习 (RL) 的稳定性和效率。STARE 通过根据惊奇度重新加权 token 级优势来解决策略熵崩溃问题,在推理基准测试中显示出更高的准确性。GrowthHacker 利用 LLM 代理自主优化离策略评估 (OPE) 代码,证明了改进 OPE 系统的可行性。ZPPO 将教师模型保留在提示中而不是策略梯度中,从而增强了小型学生模型的知识蒸馏。GD$^2$PO 通过过滤掉具有…
-
新的HERO框架通过事后反馈增强AI代理学习
研究人员推出了一种新颖的强化学习代理框架HERO,旨在改进多轮决策。与依赖最终结果的传统方法不同,HERO使用事后增强的自我蒸馏,并将下一个环境观察作为局部反馈。这种方法将每次观察转换为一个紧凑的轮次级诊断,为代理的行为提供可操作的见解。HERO在TauBench和WebShop等基准测试中,尤其是在成功部署不频繁的有限训练预算下,已证明了任务成功率的提高和不必要轮次的减少。
-
AI代理跨多个环境使用单一重排序器
研究人员开发了一种方法,可以在多个基于文本的代理环境中训练单一的神经网络重排序器来执行动作选择,从而降低推理成本。通过在ALFWorld、WebShop和ScienceWorld上联合训练DeBERTa-v3模型,他们取得了显著的性能提升,并展示了积极的跨领域迁移能力。这种方法具有高度的样本效率,只需极少的微调数据即可恢复可观的性能,并表明数据多样性比模型容量对于跨环境适应更重要。
-
新的强化学习方法提升大语言模型的推理和效率
两篇新的研究论文介绍了用于增强语言模型推理的新型强化学习技术。第一篇 GAGPO 提出了一种无批评者的方法,用于在多轮环境中进行精确的时间信用分配,从而改进了与步骤对齐的学习。第二篇 CoDistill-GRPO 提出了一种联合蒸馏方法,用于同时训练大型和小型语言模型,使得分组相对策略优化对于小型模型来说更高效、更易于使用。