Common Weakness Enumeration
PulseAugur coverage of Common Weakness Enumeration — every cluster mentioning Common Weakness Enumeration across labs, papers, and developer communities, ranked by signal.
8 天有情绪数据
-
新基准测试AI代理定位软件漏洞的能力
研究人员推出了Vulnerability Localization Benchmark (VLoc Bench),这是一个新的数据集,旨在评估AI代理在软件仓库中识别与安全漏洞相关的特定代码位置的能力。该基准包含290个仓库和147个通用弱点枚举 (CWE) 类别的500个真实世界漏洞,测试代理精确定位受影响文件的能力。对27个语言模型和4个静态分析工具的初步评估显示,仓库规模的漏洞定位仍然是一个重大挑战,表现最好的系统仅达到0.22…
-
AI代码生成安全性通过新基准和动态测试进行评估
两篇新的研究论文探讨了使用AI模型生成安全代码的挑战。第一篇论文介绍了CodeSecEval,一个用于评估安全代码生成的基于执行的基准测试,并提出了SecAwareCoder,一个旨在默认生成更安全代码的基于代理的框架。第二篇论文研究了“静态通过,动态失败”现象,即通过静态分析工具的代码在运行时仍然包含可利用的漏洞,尤其是在AI生成的Python代码中。这项研究强调了静态分析的局限性,并表明需要更动态和全面的安全评估方法。
-
新框架将漏洞历史转化为可执行的检测规则
研究人员开发了 BUGSTONE-E2E,一个旨在将历史漏洞数据转化为可执行检测规则的框架。该系统挖掘修复提交以创建可重用规则,然后通过多阶段检测管道进行处理。该管道最初使用轻量级分析,然后使用基于 LLM 的代理对潜在漏洞进行更深入的检查。该框架旨在使过去的漏洞信息在自动化检测和修复方面更具可操作性。
-
新框架可实现对AI生成代码的定向投毒
研究人员开发了一个名为CodePoisonRAG的新框架,该框架可以向检索增强代码生成(RACG)系统生成的代码中注入特定的漏洞。该框架通过将良性代码转换为有毒的伪造品来工作,即使攻击者无法访问受害者的内部系统,这些伪造品也能与攻击者选择的弱点相符。这些有毒的伪造品被设计成在语义上被错误标记,看起来是安全的,但实际上包含漏洞。实验表明,在不同代码生成模型甚至针对CodeGuarder等安全系统传播这些定向弱点方面,成功率很高。
-
Athena系统利用知识图谱识别易受攻击的软件库
研究人员开发了Athena,一个新颖的基于图的系统,用于识别受软件漏洞影响的库。与将漏洞数据视为孤立文本的先前方法不同,Athena将此信息建模为知识图谱。该系统利用知识图谱补全技术来预测给定漏洞的缺失受影响库的详细信息。最终的重新排序模块通过结合图嵌入和LLM分析,进一步优化了这些预测,显著优于现有的最先进方法。
-
Anthropic 将先进的 Claude Mythos 5 集成到 Claude Security 中,用于企业漏洞扫描
Anthropic 已将其先进的 Claude Mythos 5 模型集成到其 Claude Security 产品中,为企业客户提供增强的漏洞扫描功能。此新功能允许团队扫描 GitHub 存储库中的代码缺陷,模型可在不授予对强大 AI 的直接访问权限的情况下提供详细的发现和建议的补丁。此打包旨在减轻与模型强大的网络安全技能相关的风险,防止其被滥用于生成漏洞利用。此外,Anthropic 还启动了 Defender Advantage…
-
新代理检测 RAG 系统中的错误信息
研究人员开发了一个“评估代理”(Evaluation Agent),以解决检索增强生成(RAG)系统中的安全性和可靠性差距。该代理充当中间件,通过验证事实准确性并识别恶意文档,在它们影响大型语言模型(LLM)的输出之前,检测错误信息和知识中毒。该系统在检测某些类型的攻击方面取得了很高的准确率和精确率,尽管细微的语义操纵仍然具有挑战性。
-
新的CTIFoundry语料库脚手架提升LLM代理的网络威胁情报能力
研究人员推出CTIFoundry,一个旨在增强LLM代理在网络威胁情报(CTI)方面能力的新语料库脚手架。该系统通过从CVE、CWE、CAPEC和ATT&CK等权威知识库创建本体图谱,并使用规范实体索引威胁报告来构建CTI数据。CTIFoundry通过专门的工具和技能为代理提供结构化信息访问,从而提高调查的准确性和效率。
-
AI代码生成管道应对安全漏洞
一篇新的研究论文介绍了一个自动化管道,旨在检测和修复由AI开发工具生成的代码中的安全漏洞。该管道处理来自LLM生成提示的代码,使用CodeQL和Bandit等工具进行扫描,并利用LLM来验证和修复发现的问题。对四种Claude模型(Opus 4.8、Sonnet 4.6、Sonnet 5和Haiku 4.5)的评估显示,静态分析器发现的问题显著减少,尽管修复有时会引入新的漏洞。
-
新的VICBench基准评估代码漏洞检测工具 · 已追踪2个来源
研究人员推出了VICBench,一个旨在评估代码漏洞检测工具的新基准。该基准包含100个经过验证的、在Python、Java和C++的88个项目中引入漏洞的提交(VICs),涵盖48种通用弱点枚举(CWE)类型。VICBench的特点是复杂的、真实的漏洞修复及其对应的VICs,这些VICs比先前数据集中的要大得多。使用VICBench进行的评估表明,V-SZZ和LLM4SZZ等当前最先进的算法仅获得中等F1分数,凸显了在自动化漏洞检测…
-
新的 AVE 标准解决了 AI Agent 行为漏洞分类问题
一种名为 AVE(Agentic Vulnerability Enumeration)的新开放标准已被开发出来,用于对 AI Agent 的行为漏洞进行分类,填补了现有系统(如 CVE 和 CWE)留下的空白。这些传统系统对于 Agentic AI 来说是不够的,因为它们是为代码特定漏洞设计的,而不是 AI 组件(如 MCP 服务器或 LLM 插件)中发现的行为模式。AVE 为这些独特的漏洞提供了稳定的、厂商中立的 ID 和详细描述,…
-
新分类器将 CVE 映射到 MITRE ATT&CK 技术,LLM 标签显示无益处
研究人员开发了一个可复现的流程,使用自由文本描述将常见漏洞和暴露 (CVE) 映射到 MITRE ATT&CK Enterprise 技术。他们基于专家标注数据构建的自定义训练分类器,其性能显著优于零样本基线。对使用 LLM 辅助标签扩展此数据集的调查显示,此类标签并未提供可靠的改进,甚至可能降低性能,这表明标签质量而非仅仅是数据集大小,是分类器准确性的关键因素。
-
新训练方法提升 AI Python 漏洞预测能力
研究人员开发了一种新的方法来训练 AI 模型预测 Python 代码中的软件漏洞,特别关注通用弱点枚举 (CWE) 分类法。他们发现,直接使用层级惩罚作为训练信号,尤其是在强化学习中,在分布变化下显著优于监督方法。该方法在特定数据集上成功将 Qwen2.5-Coder-7B 模型的惩罚降低了 25% 以上,达到了与更大规模的零样本模型相当的性能。
-
思科基金会AI发布Antares模型用于代码漏洞定位
思科基金会AI推出了Antares,这是一个新系列开源小型语言模型,专门用于代码漏洞定位。Antares-350M和Antares-1B模型可在Hugging Face上获取,并基于IBM Granite 4.0检查点。除了模型,思科还发布了漏洞定位基准(VLoc Bench)来评估其性能。虽然与GPT-5.5等大型模型相比未达到最先进水平,但Antares-1B在其尺寸范围内表现强劲,在识别易受攻击文件方面优于更大的开源模型和传统的…
-
开放权重LLM在自动驾驶汽车威胁情报生成方面的评估
研究人员开发了一个新的数据集CAV-STIXGen,用于评估开放权重大型语言模型(LLM)在生成自动驾驶汽车漏洞结构化威胁信息方面的能力。该研究评估了11个LLM,其中单模型配置在结构化数据对象(SDO)和通用弱点枚举(CWE)映射方面取得了较高的F1分数,但MITRE ATT&CK映射难度较大。使用Gemma-4-31B和Codestral-22B的多智能体设置在SDO和SRO生成方面也显示出有希望的结果,表明AI在交通安全领域自动…
-
新的RoBERTa框架解决了网络安全漏洞分类中的类别不平衡问题
一篇新的研究论文提出了一种层次感知RoBERTa框架,用于解决使用通用弱点枚举(CWE)分类法进行网络安全漏洞分类中的类别不平衡问题。该框架通过可学习的父类嵌入显式地整合CWE结构信息,以保持分类法的一致性。在CWE研究概念数据集上的实验表明,该方法实现了0.76的加权F1分数,优于SMOTE和ADASYN等传统过采样技术,并显著提高了少数类别的性能。
-
FLARE-AI 推出报告 AI 漏洞的平台
FLARE-AI 推出了一个旨在促进报告 AI 漏洞的新平台。这个开放共享的解决方案旨在满足识别和纠正 AI 模型缺陷日益增长的需求。该平台旨在提高人工智能系统的安全性和可靠性。
-
新的SecVecCoder方法增强了LLM代码生成的安全性
研究人员开发了一种名为SecVecCoder的新方法,该方法使用任务向量来提高大型语言模型(LLM)生成代码的安全性和功能性。该技术修改LLM权重以增强可信度,而无需进行生成后调整。SecVecCoder在各种LLM和编码基准测试中,将可信代码补全能力提高了高达36.0个百分点,在处理未见过的安全漏洞类型方面取得了显著的进步。
-
BERT模型在CVE到CWE映射中的比较,分类法结构是关键
研究人员探讨了多类别与多标签BERT模型在将通用漏洞披露(CVE)映射到通用弱点枚举(CWE)类别方面的有效性。他们的研究评估了BERT Base、SecureBERT和CySecBERT在不同标签空间大小下的表现,发现多类别训练通常能获得更高的宏F1分数。然而,随着标签空间的减小,多类别与多标签方法之间的差距缩小,并且事后阈值优化在较小的设置中进一步缩小了这一差距。分析还显示,主要的错误模式在所有测试的编码器中都保持一致,并且很大程…
-
BERT 模型在网络安全研究中用于 CVE 到 CWE 映射的比较
一篇新的研究论文探讨了不同 BERT 模型在将常见漏洞和暴露 (CVE) 映射到常见弱点枚举 (CWE) 类别方面的有效性。该研究使用 BERT Base、SecureBERT 和 CySecBERT 比较了多类别和多标签分类方法。结果表明,多类别训练通常能获得更高的宏观 F1 分数,尽管在标签空间较小时差距会缩小。研究还表明,CWE 分类法的结构对分类错误有显著影响,其影响程度超过了编码器的选择。