百度文心一言任务代理已在国际PinchBench v2排行榜上名列前茅,超越了Anthropic的Claude Opus 4.8和OpenAI的GPT-5.6-luna等模型。该代理的最高得分和平均得分分别为94.6%和94.4%,标志着其成为首个在此基准测试中获得第一名的中国代理系统。PinchBench评估的是代理完成复杂、真实世界任务并产生可验证结果的能力,而非仅仅是知识回忆,这突显了系统架构和工程与模型能力同等重要。 AI
影响 为AI代理完成复杂任务的能力树立了新的基准,可能推动代理框架开发的竞争。
排序理由 该集群报告称,一家主要科技公司的产品在一个重要的AI代理基准测试中名列前茅,超越了现有竞争对手。[lever_c_demoted from frontier_release: ic=2 ai=1.0]
- Anthropic
- Baidu
- Claude Opus 4.8
- Claude Opus 4.8-fast
- GPT-5.6-luna
- Kilo AI
- OpenAI
- OpenClaw
- PinchBench v2
- 阿里通义千问 Qwen3.7-max
- Wenxin Assistant Task Agent
- Anthropic Claude Opus 4.8
- Anthropic Claude Opus 4.8-fast
- OpenAI GPT-5.6-luna
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →