Meta AI 推出了 EvoHarness-RL,这是一种训练智能体执行长时程任务的新颖方法。这项研究通过使智能体能够离线学习约束策略,然后在运行时构建和更新外部约束状态,从而摆脱了手动编写的智能体约束。EvoHarness-RL 框架暴露了诸如信念、进度和经验等约束状态,允许策略对其进行操作。通过监督微调和成本感知 GRPO 探索,智能体学会何时访问、更新和巩固信息,从而更有效地执行长时程任务。该方法表明,与仅仅增加工具复杂性或内存大小相比,可训练的协调策略为长时程智能体提供了更大的优势。 AI
影响 这项研究为训练 AI 智能体更有效地处理复杂、长时程任务提供了一个新范例。
排序理由 详细介绍一种新的 AI 智能体训练方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
在 X — Omar Sanseviero (HF research) 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →