华尔街投资银行Jefferies近期进行的一项真实办公任务测试评估了八款主流AI智能体。阿里巴巴的Qwen Office表现最佳,超越了Claude Cowork和Codex等竞争对手。评估强调了Qwen Office在复杂任务、网页浏览控制和多模态内容生成方面的均衡表现,是唯一在所有测试维度得分均高于90的智能体。报告还强调了“Harness”组件——围绕模型的工程机制——在将AI智能转化为实际结果方面的重要性,Qwen Office在此方面也处于领先地位。 AI
影响 为AI智能体在真实办公任务中的表现树立了新的标杆,强调了工程与核心模型同等重要。
排序理由 该集群报告了AI智能体独立基准测试的结果,这是一种研究里程碑。 [lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →