PulseAugur
实时 07:48:48
English(EN) MMShopBench: A Real-Log Benchmark for Multimodal, Multi-Turn Shopping Agents

新的MMShopBench基准测试评估多模态AI购物代理

研究人员推出MMShopBench,这是一个旨在评估多模态、多轮购物代理的新基准测试。与依赖纯文本或合成数据的先前基准测试不同,MMShopBench利用真实世界的购物日志,结合图像和对话,以更好地代表复杂的用户需求。该基准测试包含购买意图和产品要求的地面真实标注,挑战代理从多模态输入中推断这些信息,并根据这些信息验证候选产品。初步评估表明,使用提供的训练数据对开源模型进行微调可以显著提高其性能,缩小与领先的专有模型的差距。 AI

影响 该基准测试有望推动更强大的AI购物助手的发展,这些助手能够更好地理解和满足复杂的多模态用户请求。

排序理由 该集群描述了一个新的AI代理学术基准测试。

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的MMShopBench基准测试评估多模态AI购物代理

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Zeying Hao, Hao Guo, Mengtao Xu, Yimin Hu, Yuheng Song, Zesheng Zhou, Jinsong Lan, Xiaoyong Zhu ·

    MMShopBench:面向多模态、多轮购物智能体的真实日志基准测试

    arXiv:2607.29002v1 Announce Type: new Abstract: Online shoppers increasingly turn to AI shopping assistants, using images and multi-turn dialogue to express and refine product needs that are difficult to articulate in text alone. However, existing benchmarks largely rely on text-…