ALFWorld
PulseAugur coverage of ALFWorld — every cluster mentioning ALFWorld across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
新的任务进度蒸馏有效训练小型AI代理
研究人员开发了一种名为任务进度蒸馏(TPD)的新方法,可以更有效地训练小型AI代理。该方法将大型AI模型执行的每个动作与指示任务当前阶段的简洁标签配对。在ALFWorld环境中进行测试时,使用TPD和404个演示训练的学生代理在未见过的任务上取得了72.4%的成功率,显著优于仅接受推理或仅动作监督训练的学生代理。事实证明,明确的任务进度标签在演示次数有限的情况下特别有益,与仅动作监督相比,性能从48.0%提升到67.7%。
-
新的水印方法增强了大型语言模型代理的溯源能力,使其更能抵抗伪造
研究人员开发了一种名为语义行为水印(SBW)的新方法,可以在不改变其输出令牌的情况下,将溯源信息嵌入到大型语言模型代理的行为中。与之前容易受到简单释义或伪造攻击的方法不同,SBW 基于语义行为集群,并使用带密钥的抗碰撞分箱技术来防止对手创建伪造的轨迹。该方法在各种大型语言模型代理和基准测试中表现出对释义和伪造的鲁棒性显著提高,但并未完全解决链式重放攻击。
-
新研究解决语言代理的长期决策问题 · 跟踪4个来源
研究人员正在开发新方法来提高语言代理的长期决策能力。一种方法RELACE使用回顾性似然评分来评估动作在原始和结果增强上下文中的合理性,在ALFWorld和WebShop等任务上显示出显著的改进。另一个框架无状态语言代理(SLAs)将研究状态与代理对话分开,使无状态代理能够专注于顾问分配的特定任务,从而以更少的token获得更好的性能。此外,一项关于动作校准的研究表明,明确地将过去的行为与其结果联系起来并使用学习到的校准器可以防止无效的…
-
Jevíčko判断模型擅长评估,但在模拟方面存在困难
一篇新研究论文介绍了一个名为“Jevíčko”的判断模型,该模型在根据提供的信息评估选项方面表现出色,但在需要模拟或预测的任务中遇到困难。该模型在认知反射测试中表现异常出色,解决了其中99%的反直觉问题。然而,当Jevíčko需要在矩阵游戏或ALFWorld等文本环境中预测未来状态或对手行为时,它会失败。研究人员建议,将代码集成来处理模拟方面,同时让Jevíčko专注于评估,可以显著增强其作为专家控制器的能力。
-
新的AI智能体蒸馏技术可应对性能崩溃并利用依赖性
研究人员开发了新的方法,通过迭代自蒸馏和利用蒸馏来提高AI智能体的性能。ReSAIL技术通过优先处理信息丰富的交互步骤并保留关键信息来解决迭代自蒸馏中的性能崩溃问题,从而在ALFWorld和TextCraft等基准测试中显著提高了智能体的成功率。另外,Harness-Zero方法侧重于将专门的智能体利用的优势蒸馏到模型权重中,从而在部署过程中移除外部利用时也能保持这些优势。该方法在各种领域中都显示出任务成功率和利用引起的行为恢复方面的显著改进。
-
SkillGLoW方法增强了LLM智能体在复杂任务上的自改进能力
研究人员开发了一种新颖的方法SkillGLoW,使LLM智能体能够通过将技能整合到程序化家族中来提高其在长时任务上的表现。该方法解决了现有方法的局限性,这些方法要么退化为通用知识,要么维护不易重用的特定任务条目。SkillGLoW的系统从局部技能创建去实例化的全局先验,从而形成一个更紧凑、更有效的库。在多个基准测试和模型上,SkillGLoW显示出比基线方法显著的性能提升,并优于单一文档优化器。
-
新的记忆系统APEX-EM提升LLM智能体性能
研究人员开发了APEX-EM,一个新颖的非参数记忆系统,旨在增强大型语言模型智能体的能力。该系统将完整的程序-情景轨迹存储在结构化知识图中,使智能体能够回忆和重用先前遇到的任务的解决方案,从而避免冗余推理。APEX-EM采用计划-检索-生成-迭代-摄入(Plan-Retrieve-Generate-Iterate-Ingest)工作流程来管理和存储成功与失败的经验。在使用GPT-4o和Opus等模型在BigCodeBench和Life…
-
新论文揭示嵌入检索的表面形式偏差
一项新的研究论文探讨了当前嵌入检索系统的局限性,特别是它们依赖表面形式相似性而非底层结构含义。研究发现,在竞赛数学等领域,当措辞被故意伪装时,检索模型无法识别相关项目,通常会优先选择词汇相似但语义不正确的結果。虽然大型语言模型(LLM)重新排序器在提高检索准确性方面显示出潜力,尤其是在数学领域,但该论文认为,当前的基准可能无法充分捕捉真正的结构理解。
-
TACIT-SWITCH 优化LLM代理的成本-可靠性权衡
研究人员开发了TACIT-SWITCH,一种新颖的LLM代理方法,可优化成本和可靠性之间的权衡。该方法学习策略,仅在必要时升级到更大、更昂贵的模型,这基于累积的轨迹证据和教师标注的干预时间。在模拟中,TACIT-SWITCH 在保持可比成本的同时,展示了比基线路由方法更高的成功率,在ALFWorld和DABench基准测试中尤其有效。
-
AgentOCR框架将LLM Agent历史压缩成图像,降低成本
研究人员开发了AgentOCR,一个旨在降低大型语言模型(LLM)Agent历史相关的高昂token和内存成本的新颖框架。AgentOCR通过将Agent的交互历史转换为紧凑的图像来实现这一点,利用了视觉token卓越的信息密度。该系统包含分段光学缓存,以避免冗余的重新渲染,并采用Agentic自压缩,允许Agent自适应地平衡任务成功率和token效率。在ALFWorld和基于搜索的QA等基准上的实验表明,AgentOCR在保持文本…
-
新的AUSO方法优化AI代理技能,从指导到利用
研究人员引入了AUSO(动作级统一技能优化),一种新颖的AI代理训练方法,它将技能从外部指导逐步整合到内部决策知识中。该方法旨在改进代理在其策略演变过程中学习和利用技能的方式。AUSO在训练早期联合学习教师指导和环境结果,然后转向基于结果的优化,最后根据有技能条件和无技能条件的上下文评估动作,以完善技能利用。在ALFWorld、WebShop和SearchQA基准上的实验表明,AUSO增强了代理的性能和泛化能力。
-
新方法通过引导式探索提升 Agentic 强化学习
两篇新的研究论文介绍了增强 Agentic 强化学习的创新方法,解决了复杂、长时程任务中奖励稀疏的挑战。Agent-G$^2$ 提出了一个高斯引导框架,用于估计探索的最佳轨迹深度范围,其性能优于现有方法,且滚动成本显著降低。另一方面,EDGE 专注于将检索到的经验的好处直接提炼到参数策略中,使智能体能够在没有外部指导的情况下内化探索模式并保持性能。
-
神经符号智能体增强具身AI计划的可执行性
研究人员开发了一种新颖的神经符号智能体,旨在提高由语言和视觉语言模型生成的具身计划的可执行性。该智能体解决了模型输出可能违反环境动态或错误识别实体的问题。它首先使用视觉语言模型和探索技术来收集相关信息并创建符号初始状态,然后使用PDDL转换模型将规划限制在有效操作内。这种方法确保了计划在构建时即可执行,并在VirtualHome和ALFWorld基准测试中取得了超过90%的成功率,显著优于直接视觉策略。
-
新研究解决了长时序任务中LLM智能体的信用分配问题 · 已追踪2个来源
两篇新研究论文探讨了改进大型语言模型(LLM)智能体信用分配的方法,特别是在成功信号稀疏的长时序任务中。第一篇论文《无真实标签的信用分配》(Credit Without Ground Truth)在ALFWorld中根据因果真实标签审计了现有的信用信号,发现它们表现不佳,常常反映模型流畅性而非实际贡献。第二篇论文《TRCA:逐转换评分信用分配》(TRCA: Transition-wise Rubric Credit Assignmen…
-
新的CAPS框架弥合了视觉-文本压缩中的智能体策略差距
研究人员开发了一个名为CAPS(跨模态智能体策略自蒸馏)的新框架,以解决多步语言模型智能体在视觉-文本压缩中的能力差距。当交互历史被转换为图像时,这种差距会出现,从而影响智能体性能。CAPS采用两阶段自蒸馏过程,使用更强的文本历史策略作为监督者来训练视觉历史智能体策略。该方法在SearchQA和ALFWorld等任务上显著提高了性能,同时大幅降低了内存-上下文成本。
-
新方法将推理技能蒸馏到语言模型中,降低了代币成本
研究人员开发了一种方法,通过将知识蒸馏成紧凑的自然语言技能来提高语言模型中推理的效率。这种方法通过将现有轨迹中的共享过程编译成一种技能,然后将其注入到非推理模型的系统提示中,从而分摊了推理的成本,而推理通常需要 3-6 倍的输出代币。在四个代理基准测试中,该技术为 GPT-5.4-mini 恢复了 55%-100% 以上的推理差距,通常在显著减少代币使用量的同时,性能优于推理模式。
-
新框架利用LLM的内部情感来改进智能体技能选择
研究人员开发了Emotion2Skill,一个利用大型语言模型(LLM)内部情感信号来增强基于技能的智能体性能的新颖框架。该方法从LLM的残差流中提取27维情感向量,并将其整合到智能体的决策过程中,用于技能选择和演化。通过分析情感轨迹,Emotion2Skill可以识别和纠正存在问题的技能调用,从而显著提高任务成功率。在WebShop和ALFWorld基准测试中使用Qwen3-8B和Qwen3-14B模型进行测试时,Emotion2S…
-
新的MemWM模型通过增强记忆来提升AI规划能力
研究人员开发了MemWM,一种新颖的增强记忆的文本世界模型,旨在通过解决系统性预测错误来改进规划代理。MemWM包含一个精心策划的过渡规则、状态缓存和关键事实的记忆库,以条件化下一状态的想象。评估表明,这种记忆增强显著提高了规划代理的事实状态保持能力和下游任务成功率,在结构化状态保真度方面提高了206.3%,在规划任务中相对提高了65.4%。
-
新研究解决 LLM 代理的信用分配问题 · 已追踪 2 个来源
arXiv 上的两篇新研究论文探讨了大型语言模型代理的高级信用分配技术。第一篇论文《从推理到代理:大型语言模型强化学习中的信用分配》综合了现有研究,以应对在复杂的代理环境中确定哪些具体行动或推理步骤能带来预期结果的挑战。第二篇论文《Gated-BEPO:置信门控贝尔曼信用分配用于大型语言模型代理》引入了一种名为 Gated-BEPO 的新方法,该方法使用经验性滚动图和置信门来更有效地将稀疏终端结果的奖励传播到单个行动,并在各种基准测试…
-
Meta 研究人员揭示新的 AI 扩展定律和智能体(agent)利用方法
Meta 研究人员发布了两篇论文,详细介绍了 AI 扩展定律和智能体(agent)利用开发方面的进展。第一篇论文提出了一种将模型容量和训练数据相结合的“扩展定律”(Scaling law),提高了损失预测的准确性,并减少了规划预训练预算的计算需求。第二篇论文提出了 EvoHarness-RL,一种使智能体(agent)能够离线学习利用策略(harness policies)的方法,从而能够执行更鲁棒的长期任务,并在 ALFWorld …