阿里巴巴的 Qwen 团队推出了 CommerceAgentBench,这是一个新的基准测试,旨在评估 AI 模型在真实商业执行任务上的表现,而不仅仅是生成答案。在初步测试中,他们的 Qwen3.8-Max 模型在这些复杂的商业操作中表现出最强的性能,完成率约为 62%。 AI
影响 该基准测试可能会将 AI 模型评估的重点转移到商业环境中的实际执行能力上,从而影响未来的模型开发。
排序理由 发布新的 AI 模型评估基准测试。 [lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →