实体
ShoppingBench
ShoppingBench
PulseAugur coverage of ShoppingBench — every cluster mentioning ShoppingBench across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
新的基准测试揭示大型语言模型(LLM)代理在复杂的购物和零售任务中存在困难
研究人员开发了新的基准测试来评估大型语言模型(LLM)代理在复杂、真实场景中的能力。ShoppingBench 和 EComAgentBench 专注于涉及隐藏意图、预算管理和多产品采购的复杂购物任务,揭示即使是 GPT-4.1 等先进模型也难以达到高成功率。同样,RetailBench 在长周期的零售管理模拟中评估 LLM 代理,突显了与最优策略相比,它们在决策和策略一致性方面存在显著差距。
-
AI代理被训练来导航长购物历史
研究人员开发了新的方法来训练AI代理理解长客户购物轨迹,这项任务以前受到大型语言模型中上下文窗口限制的制约。一种方法利用Bittensor网络上的“代理竞技场”为购物代理生成多样化、经过评判的训练数据,显著提高了它们在基准测试上的表现。另一种方法引入了一个框架,允许代理通过工具增强的交互自主地从外部文件中检索和解析长轨迹,从而有效地绕过了LLM的上下文限制,并在新的长上下文基准测试中展示了强大的性能。