研究人员评估了开源大语言模型在修复 PDDL(规划领域定义语言)模型错误方面的有效性,PDDL 对于 AI 规划至关重要。他们的实验表明,尽管表现最佳的 LLM 取得了 0.87 的 F1 分数,显著优于符号基线,但其测试通过率却很低。即使包含测试轨迹,模型在满足可靠的自动化模型修复所需约束方面仍面临挑战,尤其是在复杂域上。 AI
影响 当前的开源 LLM 在自动化 AI 规划模型修复方面尚不可靠,表明需要在推理和约束满足方面进行进一步开发。
排序理由 评估 LLM 在特定 AI 任务上能力的论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →