PulseAugur
实时 10:04:15
English(EN) LLM-Only PDDL Domain Repair with Open-Weight Models

开源 LLM 展现潜力但 PDDL 模型修复能力不足

研究人员评估了开源大语言模型在修复 PDDL(规划领域定义语言)模型错误方面的有效性,PDDL 对于 AI 规划至关重要。他们的实验表明,尽管表现最佳的 LLM 取得了 0.87 的 F1 分数,显著优于符号基线,但其测试通过率却很低。即使包含测试轨迹,模型在满足可靠的自动化模型修复所需约束方面仍面临挑战,尤其是在复杂域上。 AI

影响 当前的开源 LLM 在自动化 AI 规划模型修复方面尚不可靠,表明需要在推理和约束满足方面进行进一步开发。

排序理由 评估 LLM 在特定 AI 任务上能力的论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

开源 LLM 展现潜力但 PDDL 模型修复能力不足

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Nader Karimi Bavandpour, Pascal Bercher ·

    使用开源模型进行仅 LLM 的 PDDL 域修复

    arXiv:2608.17341v1 Announce Type: new Abstract: AI planning is concerned with finding a sequence of actions that achieves a specified goal. It relies on explicit models of the world, commonly represented in the Planning Domain Definition Language (PDDL). An active line of researc…