开发了一个网络安全基准测试,用于评估本地AI模型的能力,特别是Qwen3.8 27B。该基准测试在隔离的Docker环境中进行,涉及pwn、Web漏洞利用和取证等任务,结果显示Qwen3.8 27B首次尝试得分28.1%。相比之下,MiMo 2.6 Flash和GPT-6 Luna等商业模型表现出显著更高的性能,分别解决了73.7%和90.9%的任务。创建者还指出,基准测试任务是保密的,以防止它们被纳入未来的训练数据。 AI
影响 该基准测试为理解本地LLM在网络安全方面的实际能力提供了见解,让开发人员和安全专业人员了解其潜力和局限性。
排序理由 该集群描述了一个自定义构建的基准测试及其特定AI模型的结果,属于研究范畴。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →