PulseAugur
实时 14:47:04
实体 ALFWorld

ALFWorld

PulseAugur coverage of ALFWorld — every cluster mentioning ALFWorld across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
16
90 天内 46
发布 · 30天
0
90 天内 0
论文 · 30天
16
90 天内 45
层级分布 · 90 天
主题
关系
情绪 · 30 天

8 天有情绪数据

最近 · 第 1/3 页 · 共 46 条
  1. TOOL · CL_216021 ·

    AgentOCR框架将LLM Agent历史压缩成图像,降低成本

    研究人员开发了AgentOCR,一个旨在降低大型语言模型(LLM)Agent历史相关的高昂token和内存成本的新颖框架。AgentOCR通过将Agent的交互历史转换为紧凑的图像来实现这一点,利用了视觉token卓越的信息密度。该系统包含分段光学缓存,以避免冗余的重新渲染,并采用Agentic自压缩,允许Agent自适应地平衡任务成功率和token效率。在ALFWorld和基于搜索的QA等基准上的实验表明,AgentOCR在保持文本…

  2. TOOL · CL_215910 ·

    新的AUSO方法优化AI代理技能,从指导到利用

    研究人员引入了AUSO(动作级统一技能优化),一种新颖的AI代理训练方法,它将技能从外部指导逐步整合到内部决策知识中。该方法旨在改进代理在其策略演变过程中学习和利用技能的方式。AUSO在训练早期联合学习教师指导和环境结果,然后转向基于结果的优化,最后根据有技能条件和无技能条件的上下文评估动作,以完善技能利用。在ALFWorld、WebShop和SearchQA基准上的实验表明,AUSO增强了代理的性能和泛化能力。

  3. RESEARCH · CL_206203 ·

    神经符号智能体增强具身AI计划的可执行性

    研究人员开发了一种新颖的神经符号智能体,旨在提高由语言和视觉语言模型生成的具身计划的可执行性。该智能体解决了模型输出可能违反环境动态或错误识别实体的问题。它首先使用视觉语言模型和探索技术来收集相关信息并创建符号初始状态,然后使用PDDL转换模型将规划限制在有效操作内。这种方法确保了计划在构建时即可执行,并在VirtualHome和ALFWorld基准测试中取得了超过90%的成功率,显著优于直接视觉策略。

  4. RESEARCH · CL_205996 ·

    新研究解决了长时序任务中LLM智能体的信用分配问题 · 已追踪2个来源

    两篇新研究论文探讨了改进大型语言模型(LLM)智能体信用分配的方法,特别是在成功信号稀疏的长时序任务中。第一篇论文《无真实标签的信用分配》(Credit Without Ground Truth)在ALFWorld中根据因果真实标签审计了现有的信用信号,发现它们表现不佳,常常反映模型流畅性而非实际贡献。第二篇论文《TRCA:逐转换评分信用分配》(TRCA: Transition-wise Rubric Credit Assignmen…

  5. TOOL · CL_193365 ·

    新的CAPS框架弥合了视觉-文本压缩中的智能体策略差距

    研究人员开发了一个名为CAPS(跨模态智能体策略自蒸馏)的新框架,以解决多步语言模型智能体在视觉-文本压缩中的能力差距。当交互历史被转换为图像时,这种差距会出现,从而影响智能体性能。CAPS采用两阶段自蒸馏过程,使用更强的文本历史策略作为监督者来训练视觉历史智能体策略。该方法在SearchQA和ALFWorld等任务上显著提高了性能,同时大幅降低了内存-上下文成本。

  6. TOOL · CL_193285 ·

    新方法将推理技能蒸馏到语言模型中,降低了代币成本

    研究人员开发了一种方法,通过将知识蒸馏成紧凑的自然语言技能来提高语言模型中推理的效率。这种方法通过将现有轨迹中的共享过程编译成一种技能,然后将其注入到非推理模型的系统提示中,从而分摊了推理的成本,而推理通常需要 3-6 倍的输出代币。在四个代理基准测试中,该技术为 GPT-5.4-mini 恢复了 55%-100% 以上的推理差距,通常在显著减少代币使用量的同时,性能优于推理模式。

  7. RESEARCH · CL_193382 ·

    新框架利用LLM的内部情感来改进智能体技能选择

    研究人员开发了Emotion2Skill,一个利用大型语言模型(LLM)内部情感信号来增强基于技能的智能体性能的新颖框架。该方法从LLM的残差流中提取27维情感向量,并将其整合到智能体的决策过程中,用于技能选择和演化。通过分析情感轨迹,Emotion2Skill可以识别和纠正存在问题的技能调用,从而显著提高任务成功率。在WebShop和ALFWorld基准测试中使用Qwen3-8B和Qwen3-14B模型进行测试时,Emotion2S…

  8. TOOL · CL_191142 ·

    新的MemWM模型通过增强记忆来提升AI规划能力

    研究人员开发了MemWM,一种新颖的增强记忆的文本世界模型,旨在通过解决系统性预测错误来改进规划代理。MemWM包含一个精心策划的过渡规则、状态缓存和关键事实的记忆库,以条件化下一状态的想象。评估表明,这种记忆增强显著提高了规划代理的事实状态保持能力和下游任务成功率,在结构化状态保真度方面提高了206.3%,在规划任务中相对提高了65.4%。

  9. RESEARCH · CL_191120 ·

    新研究解决 LLM 代理的信用分配问题 · 已追踪 2 个来源

    arXiv 上的两篇新研究论文探讨了大型语言模型代理的高级信用分配技术。第一篇论文《从推理到代理:大型语言模型强化学习中的信用分配》综合了现有研究,以应对在复杂的代理环境中确定哪些具体行动或推理步骤能带来预期结果的挑战。第二篇论文《Gated-BEPO:置信门控贝尔曼信用分配用于大型语言模型代理》引入了一种名为 Gated-BEPO 的新方法,该方法使用经验性滚动图和置信门来更有效地将稀疏终端结果的奖励传播到单个行动,并在各种基准测试…

  10. RESEARCH · CL_190598 ·

    Meta 研究人员揭示新的 AI 扩展定律和智能体(agent)利用方法

    Meta 研究人员发布了两篇论文,详细介绍了 AI 扩展定律和智能体(agent)利用开发方面的进展。第一篇论文提出了一种将模型容量和训练数据相结合的“扩展定律”(Scaling law),提高了损失预测的准确性,并减少了规划预训练预算的计算需求。第二篇论文提出了 EvoHarness-RL,一种使智能体(agent)能够离线学习利用策略(harness policies)的方法,从而能够执行更鲁棒的长期任务,并在 ALFWorld …

  11. RESEARCH · CL_187214 ·

    新的SMRC-SD方法增强了多轮AI代理的性能

    研究人员开发了一种名为状态匹配路由和上下文自蒸馏(SMRC-SD)的新方法,以改进多轮AI代理。该技术解决了当代理的行动导致其进入未被参考指导覆盖的状态时发生的状态-参考不匹配问题。SMRC-SD将蒸馏限制在仅匹配的状态,并构建了状态条件化的教师上下文,从而带来了显著的性能提升。当应用于Qwen3-1.7B模型时,SMRC-SD在ALFWorld上的任务成功率从0.746提升到0.865,在WebShop上的任务成功率从0.574提升…

  12. RESEARCH · CL_180525 ·

    新的蒸馏方法FTB通过验证教师指导来提高智能体性能

    研究人员开发了一种名为FutureBridge-OPD (FTB) 的新方法,以改进智能体任务的策略内蒸馏 (OPD)。标准的OPD在教师访问的状态上监督学生,但学生的偏差可能导致随时间的指导效果不佳。FTB通过观察学生的后续轨迹来评估在高分歧状态下教师指导的好处,从而解决这个问题。在ALFWorld、WebShop和ScienceWorld上的实验中,FTB在现有方法上显示出显著的性能提升,当使用Qwen3-32B作为Qwen3-1…

  13. TOOL · CL_178395 ·

    LabEvolver框架通过经验演化增强湿式实验室代理

    研究人员开发了LabEvolver,一个旨在增强湿式实验室代理能力的创新框架。该无训练系统利用执行经验中提取的片段记忆来提高代理性能。LabEvolver整合了一个内部试验循环,用于自适应感知和安全验证,以及一个外部演化循环,用于提炼已完成的轨迹,将其转化为可重用的技能和策略。在实际应用中,LabEvolver取得了显著的改进,在pH调节任务中,完成时间和安全门拦截分别减少了48%和60%以上。它还在ALFWorld基准测试中展示了增…

  14. TOOL · CL_174368 ·

    MemHarness框架使LLM代理能够重构过往经历

    研究人员推出了一种名为MemHarness的新型框架,旨在通过使大型语言模型(LLM)代理能够重构过往经历而非简单回放,来增强其能力。这种受人类记忆启发的做法允许代理将检索到的信息适应当前情境,从而避免负面迁移并改善决策。在ALFWorld和WebShop上的实验表明,MemHarness在出分布场景下显著优于现有的强化学习和静态记忆增强基线。

  15. TOOL · CL_160899 ·

    研究发现:密集奖励导致 GRPO 训练的 LLM 智能体崩溃

    研究人员发现,在使用密集预测奖励训练大型语言模型智能体时存在一个关键问题,尤其是在与 GRPO 算法结合使用时。这种旨在提供循序渐进监督的方法可能导致一种被称为“暗室”病理的现象,尽管预测准确率很高,但智能体却会进入任务成功率骤降的退化状态。研究发现,移除 GRPO 的组归一化可以解决这种灾难性的失败,这表明归一化会以一种破坏训练过程稳定的方式放大了组内方差。该研究提出了一个方差剖面标准来预测和避免此类崩溃,并指出辅助损失通道可能比奖…

  16. TOOL · CL_158547 ·

    Prefix-GRPO 增强小型语言模型以用于交互式代理

    研究人员推出了一种新颖的强化学习框架 Prefix-GRPO,旨在增强小型语言模型在交互式代理任务中的性能。该方法将教师轨迹分解为与重放对齐的前缀查询和在线续接,使学生模型能够在长视界环境中更有效地学习。在 TextCraft、BabyAI 和 ALFWorld 上的实验表明,Prefix-GRPO 通过在统一的策略优化框架内优化前缀学习和续接学习,其性能优于标准的蒸馏和强化学习基线。

  17. TOOL · CL_154050 ·

    Masked Diffusion Language Models outperform AR models for agentic RL

    一篇新的研究论文介绍了掩码扩散语言模型(MDLM)作为文本世界模型在代理强化学习中优于自回归(AR)模型的替代方案。MDLM 通过利用双向锚点感知去噪,展示了增强的一致性和扎实性,即使在后者规模大得多的情况下,其性能也优于 AR 模型。该研究还提出了一个新的 GRPO 训练框架,并在各种代理骨干网络上展示了在未见过环境中的大量零样本迁移收益。

  18. RESEARCH · CL_151913 ·

    Muon 优化器在 Agentic 强化学习任务中展现出潜力

    一篇新的研究论文探讨了 Muon 优化器在 Agentic 强化学习 (RL) 任务中的有效性,特别是在稀疏奖励环境中的应用。该研究使用 Qwen2.5-0.5B-Instruct 在 ALFWorld 基准测试上进行,发现将 Muon 整合到隐藏权重矩阵中,与标准的 AdamW 优化器相比,成功率显著提高。Muon 的优势被观察到取决于优势估计器和学习率等因素,特定配置可带来验证成功率的大幅提升和更快的收敛速度。

  19. RESEARCH · CL_135151 ·

    新的TRACE水印确保LLM代理轨迹的来源

    研究人员开发了TRACE,一种新颖的双通道水印,旨在确保LLM代理轨迹的来源。该系统能够抵御可能试图重新品牌化或替换代理的对手,因为它将水印直接嵌入到轨迹日志中。TRACE利用一个基于局部内容进行无失真动作选择的选择通道,以及一个基于日志骨架以在重写下保持不变的计数通道,从而确保即使日志被篡改也能进行归因。

  20. RESEARCH · CL_139336 ·

    具身人工智能研究在接地世界模型和代理协作方面取得进展 · 跟踪了 8 个来源

    近期研究探讨了具身人工智能的进展,重点关注生物系统如何通过环境互动获取接地世界模型。论文讨论了将人工智能智能集成到物理机器人中的框架,例如 SPINE,旨在减少对专家校准的需求。其他研究调查了人机交互作为神经可塑性训练环境,并提出了能够从经验中学习的自演化具身代理的方法。此外,研究还检查了异构代理之间的容错协作以及通过对话对齐世界模型以改善协调。