PulseAugur
实时 11:32:39
中文(ZH) 华尔街实测8款全球主流Agent:千问办公综合排名第一,超Claude Cowork、Codex

阿里巴巴的Qwen Office在AI智能体真实办公任务测试中名列前茅

华尔街投资银行Jefferies近期进行的一项真实办公任务测试评估了八款主流AI智能体。阿里巴巴的Qwen Office表现最佳,超越了Claude Cowork和Codex等竞争对手。评估强调了Qwen Office在复杂任务、网页浏览控制和多模态内容生成方面的均衡表现,是唯一在所有测试维度得分均高于90的智能体。报告还强调了“Harness”组件——围绕模型的工程机制——在将AI智能转化为实际结果方面的重要性,Qwen Office在此方面也处于领先地位。 AI

影响 为AI智能体在真实办公任务中的表现树立了新的标杆,强调了工程与核心模型同等重要。

排序理由 该集群报告了AI智能体独立基准测试的结果,这是一种研究里程碑。 [lever_c_demoted from research: ic=1 ai=1.0]

在 雷峰网 (Leiphone) 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

阿里巴巴的Qwen Office在AI智能体真实办公任务测试中名列前茅

报道来源 [1]

  1. 雷峰网 (Leiphone) TIER_1 中文(ZH) ·

    华尔街测试8款全球主流Agent:Qwen Office综合评分第一,超越Claude Cowork和Codex

    <p>8月19日消息,华尔街投行杰富瑞分析师近日对八款全球主流AI Agent 进行了真实办公任务实测,结果显示,通过模型和Harness的协同,阿里千问办公综合得分排名第一,超过美国的Claude Cowork和Codex等Agent工具。</p><p>&nbsp;</p><p>此次测试共设置5项真实办公任务,包括基于多份文件完成公司年报摘要、联网查找并比较公司经营数据、操作真实桌面浏览器完成信息检索和文档生成、根据数据制作英文PPT,以及基于参考图片生成营销海报。测试结果显示,千问办公整体表现较为均衡,尤其在复杂办公任务、网页浏览器控制以及多模态内容…