PulseAugur
实时 20:05:53
实体 EvoHarness-RL

EvoHarness-RL

PulseAugur coverage of EvoHarness-RL — every cluster mentioning EvoHarness-RL across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_190598 ·

    Meta AI 的 EvoHarness-RL 训练智能体学习长任务的协调策略

    Meta AI 推出了 EvoHarness-RL,这是一种训练智能体执行长时程任务的新颖方法。这项研究通过使智能体能够离线学习约束策略,然后在运行时构建和更新外部约束状态,从而摆脱了手动编写的智能体约束。EvoHarness-RL 框架暴露了诸如信念、进度和经验等约束状态,允许策略对其进行操作。通过监督微调和成本感知 GRPO 探索,智能体学会何时访问、更新和巩固信息,从而更有效地执行长时程任务。该方法表明,与仅仅增加工具复杂性或内…