一项对模型上下文协议(MCP)服务器生态系统的研究发现,未修复的、随机抽样的服务器的运行率远低于精心挑选的样本集。在随机抽样的400台服务器中,只有48.8%完成了初始化握手,37.5%根本未能启动。虽然在运行的服务器中JSON Schema的合规性很高,但58.8%的情况下省略了可选的安全注解。研究还强调,在BFCL v4和UltraTool等合成工具使用基准测试语料库中存在大量重复,这与真实MCP工具中观察到的近乎零重复形成鲜明对比。 AI
影响 突出了合成基准测试数据质量以及真实世界AI工具集成操作可靠性方面存在的问题。
排序理由 该集群包含一篇学术论文,详细介绍了关于AI工具使用和基准测试的研究结果。[lever_c_demoted from research: ic=1 ai=1.0]
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →