PulseAugur
中
实时 17:44:07
实体 PlanBench

PlanBench

PulseAugur coverage of PlanBench — every cluster mentioning PlanBench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 3
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_217861 ·

    AI通过多角色强化学习实现忠实的符号规划

    研究人员开发了一种新颖的多角色强化学习框架,以提高大型语言模型在符号规划中的忠实度。该框架利用单个语言模型充当Actor、Judge和Editor,生成PDDL规范,根据求解器反馈提供质量信号,并优化输出。该方法显著提高了PlanBench基准测试的成功率,平均成功率超过70%,并减少了语义漂移。

  2. TOOL · CL_210392 ·

    新的AI训练方法使用治理记录改进工作流修复

    研究人员开发了一种名为验证器选择的自训练(VSST)的方法,该方法利用机器可验证工作流中的治理记录来监督AI模型。这些记录包括任务合同、模型尝试和验证器决策,可以训练模型可靠地执行任务,而无需明确的Oracle目标或更强的教师。在PlanBench数据集上的实验表明,使用VSST训练的模型在生成已接受计划的能力方面得到了显著提高,优于其他目标选择方法。

  3. TOOL · CL_118130 ·

    新的CoSPlan基准挑战视觉规划任务中的视觉语言模型

    研究人员推出了CoSPlan,这是一个旨在评估视觉语言模型(VLM)在视觉领域顺序规划能力的新基准。与基于文本的规划不同,CoSPlan要求模型执行一系列视觉动作,检测错误步骤并进行纠正以达到目标场景。尽管采用了思维链(Chain-of-Thought)和场景图(Scene Graphs)等高级策略,VLM在CoSPlan上仍面临挑战。为解决此问题,该论文提出了场景图增量更新(SGI),一种无需训练的方法,可优化文本场景图以进行分步推…