Blocksworld
PulseAugur coverage of Blocksworld — every cluster mentioning Blocksworld across labs, papers, and developer communities, ranked by signal.
-
新的计算链架构提升了大型语言模型的规划能力
研究人员开发了一种名为计算链(Chain of Computation, COC)的新计算架构,以提高大型语言模型(LLMs)的规划能力。该架构将基于Transformer的模型集成到一个迭代循环中,并利用一个保持恒定大小但允许选择性信息访问的结构化上下文窗口(Structured Context Window, SCW)。实验表明,即使是使用COC训练的较小模型,在诸如BlocksWorld和Pancake Puzzle等规划问题上…
-
新研究聚焦大语言模型推理、长上下文和工具集成
多篇研究论文探讨了大语言模型(LLM)推理能力的进步,重点在于提高长时任务和工具集成的性能。Apple的研究引入了LEAD,一种通过整合未来验证和重叠回滚来克服LLM推理中“无恢复瓶颈”的方法,使模型能够解决跳棋跳跃等复杂问题。其他论文提出了用于工具集成推理中的逐轮回溯自我蒸馏的TurnSight,衡量解释器稳定性的方法,以及通过测试时缩放和从失败轨迹中反思性学习来分析和改进推理过程的技术。此外,研究还探讨了优化推理接口以缩短响应时间…
-
新的WA*框架在AI规划中实现了零样本泛化
研究人员开发了一个名为WA*的新型自改进规划框架,该框架将由关系图神经网络表示的价值启发式与Q学习相结合。这种方法指导搜索并利用结果数据来更新启发式,使其能够充当通用策略。该框架展示了强大的零样本泛化能力,无需搜索即可解决新的问题实例,这在稀疏奖励域中是传统深度强化学习方法的一项重大进步。该系统已在Sokoban、PushWorld、The Witness和2023年国际规划竞赛等基准测试中取得成功。
-
生成模型通过自我改进实现高质量计划生成
研究人员开发了一种用于生成模型的自我改进技术,以更有效地生成高质量计划。该方法通过模型调用和图搜索的组合生成改进的计划,然后对初始模型进行微调。在四个领域的实验表明,与传统的符号规划器相比,计划长度平均减少了 30%,并且超过 80% 的生成计划是最优的。