一项英国和美国政府联合研究发现,中国的Kimi K3大型语言模型在网络安全能力方面显著逊色于领先的美国模型。该研究使用ExploitBench基准进行,结果显示Kimi K3的总体得分为32.2%,而美国顶级模型的平均得分为76.2%。Kimi K3未能实现任意代码执行,这是美国顶级模型在多项任务中都展示出的关键漏洞利用能力。 AI
影响 凸显了与美国同类产品相比,中国AI模型可能存在的网络安全风险。
排序理由 关于使用基准测试评估AI模型能力的 연구报告。[lever_c_demoted from research: ic=1 ai=1.0]
- ExploitBench
- GLM-5.2
- Kimi k3
- Moonshot AI
- National Institute of Standards and Technology
- UK Artificial Intelligence Security Institute
- UK Department for Science, Innovation and Technology
- United States Department of Commerce
- US Centre for AI Standards and Innovation
- Zhipu AI
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →