PulseAugur
实时 09:52:53
中文(ZH) 华尔街实测8款全球主流Agent:千问办公综合排名第一,超Claude Cowork、Codex

阿里巴巴Qwen Office领跑AI智能体基准测试,表现优于Claude Cowork和Codex

杰富瑞分析师近期对八款主流AI智能体在真实办公场景下的任务表现进行了评估,阿里巴巴的Qwen Office位居榜首。该智能体在包括网页浏览和多模态内容生成在内的复杂任务中均展现出强大性能,所有测试维度得分均超过90分。报告指出,Qwen Office与其底层Qwen 3.8 Max模型协同工作,加上其工程机制(Harness),是其性能和成本效益优于Claude Cowork和Codex等竞争对手的关键。分析还强调了每任务成本以及工作流集成和生态系统协作等企业级功能在竞争激烈的AI智能体市场中的日益增长的重要性。 AI

影响 该基准测试表明,集成了模型性能和工程效率的AI智能体解决方案正成为企业市场的关键差异化因素。

排序理由 对多款AI智能体在真实任务中进行的基准评估,突出了特定产品的性能和成本优势。

在 雷峰网 (Leiphone) 阅读 →

AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →

阿里巴巴Qwen Office领跑AI智能体基准测试,表现优于Claude Cowork和Codex

报道来源 [2]

  1. 量子位 (QbitAI) TIER_1 中文(ZH) · 量子位的朋友们 ·

    华尔街测试8款全球主流Agent:Qwen Office 综合评分第一

    成本也正成为Agent商业化需要考虑的重要因素

  2. 雷峰网 (Leiphone) TIER_1 中文(ZH) ·

    华尔街测试8款全球主流Agent:Qwen Office综合评分第一,超越Claude Cowork和Codex

    <p>8月19日消息,华尔街投行杰富瑞分析师近日对八款全球主流AI Agent 进行了真实办公任务实测,结果显示,通过模型和Harness的协同,阿里千问办公综合得分排名第一,超过美国的Claude Cowork和Codex等Agent工具。</p><p>&nbsp;</p><p>此次测试共设置5项真实办公任务,包括基于多份文件完成公司年报摘要、联网查找并比较公司经营数据、操作真实桌面浏览器完成信息检索和文档生成、根据数据制作英文PPT,以及基于参考图片生成营销海报。测试结果显示,千问办公整体表现较为均衡,尤其在复杂办公任务、网页浏览器控制以及多模态内容…