Moonshot AI 的 Kimi K3 模型在网络漏洞任务上的表现明显弱于领先的美国模型,在 ExploitBench 上的得分仅为 32%,而美国模型为 76%。该模型的安全防护措施在阻止模拟攻击方面也显得不足。研究人员推测,Kimi K3 在通用基准测试中得分较高,但在安全相关评估中表现不佳的差异,可能归因于蒸馏技术,其中可能涉及 Anthropic 的模型。 AI
影响 强调了 AI 模型中潜在的安全漏洞,并表明蒸馏技术可能会影响专业性能。
排序理由 该集群报告了 AI 模型在特定任务上的基准测试结果,属于研究范畴。
- Anthropic
- British AI Security Institute
- Kimi k3
- Moonshot AI
- The Decoder
- U.S. Center for AI Standards and Innovation
- ExploitBench
- US models
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →