研究人员推出MMShopBench,这是一个旨在评估多模态、多轮购物代理的新基准测试。与依赖纯文本或合成数据的先前基准测试不同,MMShopBench利用真实世界的购物日志,结合图像和对话,以更好地代表复杂的用户需求。该基准测试包含购买意图和产品要求的地面真实标注,挑战代理从多模态输入中推断这些信息,并根据这些信息验证候选产品。初步评估表明,使用提供的训练数据对开源模型进行微调可以显著提高其性能,缩小与领先的专有模型的差距。 AI
影响 该基准测试有望推动更强大的AI购物助手的发展,这些助手能够更好地理解和满足复杂的多模态用户请求。
排序理由 该集群描述了一个新的AI代理学术基准测试。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →