PulseAugur
实时 19:01:17
English(EN) New research from Meta.

Meta AI 的 EvoHarness-RL 训练智能体学习长任务的协调策略

Meta AI 推出了 EvoHarness-RL,这是一种训练智能体执行长时程任务的新颖方法。这项研究通过使智能体能够离线学习约束策略,然后在运行时构建和更新外部约束状态,从而摆脱了手动编写的智能体约束。EvoHarness-RL 框架暴露了诸如信念、进度和经验等约束状态,允许策略对其进行操作。通过监督微调和成本感知 GRPO 探索,智能体学会何时访问、更新和巩固信息,从而更有效地执行长时程任务。该方法表明,与仅仅增加工具复杂性或内存大小相比,可训练的协调策略为长时程智能体提供了更大的优势。 AI

影响 这项研究为训练 AI 智能体更有效地处理复杂、长时程任务提供了一个新范例。

排序理由 详细介绍一种新的 AI 智能体训练方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 X — Omar Sanseviero (HF research) 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

Meta AI 的 EvoHarness-RL 训练智能体学习长任务的协调策略

报道来源 [1]

  1. X — Omar Sanseviero (HF research) TIER_1 English(EN) · omarsar0 ·

    Meta 的新研究。

    New research from Meta. Agent harnesses are still mostly authored by hand. This makes it hard to tune robust agent harnesses for long-horizon tasks. In this new work, agents learn harness policies offline and deploy them to construct and update external harness state online ht…