研究人员推出了 ComboShoppingBench,这是一个旨在评估大型语言模型 (LLM) 代理在复杂、预算受限的购物场景中的能力的新基准。该基准模拟了真实的组合购物任务,要求代理考虑商品兼容性、可用性、商店政策、配送费用、优惠券和预算限制。实验表明,即使是先进的 LLM 代理在处理这些任务时也面临困难,这表明在具有约束意识的购物能力方面仍有很大的改进空间。 AI
影响 凸显了当前 LLM 代理在预算受限购物等复杂现实世界决策任务中的局限性。
排序理由 该集群包含一篇介绍 LLM 代理新评估基准的研究论文。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →