研究人员开发了新的基准和框架,用于评估大型语言模型(LLM)代理在复杂行程规划场景中的表现。TREK基准引入了一个包含800个多约束任务的严格评估套件,侧重于可行性、无幻觉输出和响应角色,发现即使是GPT-5.6等先进模型也难以始终生成完全可行的计划。另外,AI Tour Meeting框架利用具有不同角色的多个LLM代理,通过自然语言讨论协作规划团队行程,作为分析代理行为的模拟工具和推荐系统。 AI
影响 这些进展旨在提高LLM代理在旅行规划等复杂现实任务中的可靠性和评估水平,推动代理能力的边界。
排序理由 该集群包含两篇研究论文,介绍了LLM代理的新基准和框架。
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →