PulseAugur
实时 12:00:04
中文(ZH) 百度文心助手任务Agent登顶国际权威榜单,超越Claude、GPT拿下全球智能体冠军

百度文心一言代理登顶全球智能基准测试,超越Claude和GPT

百度文心一言任务代理已在国际PinchBench v2排行榜上名列前茅,超越了Anthropic的Claude Opus 4.8和OpenAI的GPT-5.6-luna等模型。该代理的最高得分和平均得分分别为94.6%和94.4%,标志着其成为首个在此基准测试中获得第一名的中国代理系统。PinchBench评估的是代理完成复杂、真实世界任务并产生可验证结果的能力,而非仅仅是知识回忆,这突显了系统架构和工程与模型能力同等重要。 AI

影响 为AI代理完成复杂任务的能力树立了新的基准,可能推动代理框架开发的竞争。

排序理由 该集群报告称,一家主要科技公司的产品在一个重要的AI代理基准测试中名列前茅,超越了现有竞争对手。[lever_c_demoted from frontier_release: ic=2 ai=1.0]

在 量子位 (QbitAI) 阅读 →

AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →

百度文心一言代理登顶全球智能基准测试,超越Claude和GPT

报道来源 [2]

  1. 量子位 (QbitAI) TIER_1 中文(ZH) · 量子位的朋友们 ·

    百度文心助手任务代理登顶国际权威榜单,超越Claude和GPT,成为全球智能代理冠军

  2. 雷峰网 (Leiphone) TIER_1 中文(ZH) ·

    Baidu Wenxin Assistant Task Agent Tops International Authoritative List, Surpassing Claude and GPT to Become Global Intelligent Agent Champion

    <p>2026 年 7 月 17 日,百度文心助手任务 Agent,以最高分 94.6%、平均分 94.4% 的成绩,登顶全球工程向 AI 智能体评测榜单 PinchBench v2。成为首个以正式产品身份获得 PinchBench 总榜第一的国产智能体系统。</p><p>&nbsp;</p><p>在 59 个参评模型中,文心助手任务 Agent 排名第一,领先 Anthropic Claude Opus 4.8-fast(93.5%)、阿里通义千问 Qwen3.7-max(92.5%)、Anthropic Claude Opus 4.8(90.5%)、…