一篇新发表在arXiv上的研究评估了GPT和DeepSeek等大型语言模型(LLMs)在进行符号安全协议分析方面的能力。研究发现,虽然LLMs在某些安全目标上可以达到较高的召回率,但其精确度普遍较低,并且在不同运行中的判断可能不稳定。与聊天模式相比,LLMs的推理模式显示出更高的精确度,但检测到的攻击较少,其中身份验证目标尤其具有挑战性。尽管LLMs的性能尚未能与ProVerif和OFMC等专用形式化验证工具相媲美,但它们可以作为安全协议的初步筛选过滤器。 AI
影响 LLMs在安全协议分析中显示出作为初步过滤器的潜力,但尚未能与形式化验证工具相媲美。
排序理由 学术论文评估LLM在特定任务上的能力。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →