一项名为mcpbench的新基准测试已被开发出来,用于评估AI模型构建MCP(模型上下文协议)客户端和服务器的能力。MCP是由Anthropic创建的一个标准,旨在使AI系统能够访问外部服务和数据,其最新版本2026-07-28引入了无状态性。该基准测试对包括GPT-5.6变体和Claude Opus在内的各种AI模型进行了测试,评估它们根据不同的MCP版本和文档输入生成MCP客户端和服务器的能力。结果表明,GPT-5.6 Sol在为2025-11-25版本创建MCP客户端方面表现最佳,而Claude Opus 4.8和Kimi K2.7 Code在为同一版本创建服务器方面达到了100%。然而,对于较新的2026-07-28版本,性能显著下降,这表明所测试的模型缺乏对更新规范的了解。 AI
影响 突显了大型语言模型在理解不断发展的外部通信标准(如MCP)方面可能存在的知识差距。
排序理由 用于评估AI模型与外部协议交互能力的新的基准测试。[lever_c_demoted from research: ic=1 ai=1.0]
在 Mastodon — mastodon.social 阅读 →
- Anthropic
- Claude Opus 4.8
- Claude Sonnet 5
- Cloudflare
- GPT-5.6 Luna
- GPT-5.6 Sol
- GPT-5.6 Terra
- Kimi K2.7 Code
- Matt Carey
- MCP
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →