Common Weakness Enumeration
PulseAugur coverage of Common Weakness Enumeration — every cluster mentioning Common Weakness Enumeration across labs, papers, and developer communities, ranked by signal.
9 天有情绪数据
-
新的 AVE 标准解决了 AI Agent 行为漏洞分类问题
一种名为 AVE(Agentic Vulnerability Enumeration)的新开放标准已被开发出来,用于对 AI Agent 的行为漏洞进行分类,填补了现有系统(如 CVE 和 CWE)留下的空白。这些传统系统对于 Agentic AI 来说是不够的,因为它们是为代码特定漏洞设计的,而不是 AI 组件(如 MCP 服务器或 LLM 插件)中发现的行为模式。AVE 为这些独特的漏洞提供了稳定的、厂商中立的 ID 和详细描述,…
-
新训练方法提升 AI Python 漏洞预测能力
研究人员开发了一种新的方法来训练 AI 模型预测 Python 代码中的软件漏洞,特别关注通用弱点枚举 (CWE) 分类法。他们发现,直接使用层级惩罚作为训练信号,尤其是在强化学习中,在分布变化下显著优于监督方法。该方法在特定数据集上成功将 Qwen2.5-Coder-7B 模型的惩罚降低了 25% 以上,达到了与更大规模的零样本模型相当的性能。
-
思科基金会AI发布Antares模型用于代码漏洞定位
思科基金会AI推出了Antares,这是一个新系列开源小型语言模型,专门用于代码漏洞定位。Antares-350M和Antares-1B模型可在Hugging Face上获取,并基于IBM Granite 4.0检查点。除了模型,思科还发布了漏洞定位基准(VLoc Bench)来评估其性能。虽然与GPT-5.5等大型模型相比未达到最先进水平,但Antares-1B在其尺寸范围内表现强劲,在识别易受攻击文件方面优于更大的开源模型和传统的…
-
开放权重LLM在自动驾驶汽车威胁情报生成方面的评估
研究人员开发了一个新的数据集CAV-STIXGen,用于评估开放权重大型语言模型(LLM)在生成自动驾驶汽车漏洞结构化威胁信息方面的能力。该研究评估了11个LLM,其中单模型配置在结构化数据对象(SDO)和通用弱点枚举(CWE)映射方面取得了较高的F1分数,但MITRE ATT&CK映射难度较大。使用Gemma-4-31B和Codestral-22B的多智能体设置在SDO和SRO生成方面也显示出有希望的结果,表明AI在交通安全领域自动…
-
新的RoBERTa框架解决了网络安全漏洞分类中的类别不平衡问题
一篇新的研究论文提出了一种层次感知RoBERTa框架,用于解决使用通用弱点枚举(CWE)分类法进行网络安全漏洞分类中的类别不平衡问题。该框架通过可学习的父类嵌入显式地整合CWE结构信息,以保持分类法的一致性。在CWE研究概念数据集上的实验表明,该方法实现了0.76的加权F1分数,优于SMOTE和ADASYN等传统过采样技术,并显著提高了少数类别的性能。
-
FLARE-AI 推出报告 AI 漏洞的平台
FLARE-AI 推出了一个旨在促进报告 AI 漏洞的新平台。这个开放共享的解决方案旨在满足识别和纠正 AI 模型缺陷日益增长的需求。该平台旨在提高人工智能系统的安全性和可靠性。
-
新的SecVecCoder方法增强了LLM代码生成的安全性
研究人员开发了一种名为SecVecCoder的新方法,该方法使用任务向量来提高大型语言模型(LLM)生成代码的安全性和功能性。该技术修改LLM权重以增强可信度,而无需进行生成后调整。SecVecCoder在各种LLM和编码基准测试中,将可信代码补全能力提高了高达36.0个百分点,在处理未见过的安全漏洞类型方面取得了显著的进步。
-
BERT模型在CVE到CWE映射中的比较,分类法结构是关键
研究人员探讨了多类别与多标签BERT模型在将通用漏洞披露(CVE)映射到通用弱点枚举(CWE)类别方面的有效性。他们的研究评估了BERT Base、SecureBERT和CySecBERT在不同标签空间大小下的表现,发现多类别训练通常能获得更高的宏F1分数。然而,随着标签空间的减小,多类别与多标签方法之间的差距缩小,并且事后阈值优化在较小的设置中进一步缩小了这一差距。分析还显示,主要的错误模式在所有测试的编码器中都保持一致,并且很大程…
-
BERT 模型在网络安全研究中用于 CVE 到 CWE 映射的比较
一篇新的研究论文探讨了不同 BERT 模型在将常见漏洞和暴露 (CVE) 映射到常见弱点枚举 (CWE) 类别方面的有效性。该研究使用 BERT Base、SecureBERT 和 CySecBERT 比较了多类别和多标签分类方法。结果表明,多类别训练通常能获得更高的宏观 F1 分数,尽管在标签空间较小时差距会缩小。研究还表明,CWE 分类法的结构对分类错误有显著影响,其影响程度超过了编码器的选择。
-
消除的语言模型在软件漏洞分析中表现出改进的性能
一项发表在arXiv上的新研究调查了语言模型安全对齐对其在软件安全任务中效用的影响。研究人员比较了Gemma和Qwen模型的对齐版本和拒绝消除版本,发现消除版本模型在某些漏洞分析工作流程中表现更好。具体而言,消除Gemma模型显示出更高的补丁可用性和编译率,而消除Qwen模型提高了漏洞定位的准确性。
-
发布用于 LLM 的 Java 和 Rust 漏洞检测新基准
发布了两个新的基准测试集 JavaVulBench 和 RustMizan,用于评估大型语言模型在软件漏洞检测方面的能力。JavaVulBench 专注于 Java 方法,包含超过 1,740 个通用漏洞披露 (CVE),并提供多种真实的拆分策略用于测试。RustMizan 针对 Rust 漏洞,提供可编译的代码和一个突变框架来测试污染和鲁棒性。与之前使用小型代码片段且缺乏污染意识的数据集相比,这两个基准测试旨在提供更现实、更全面的评估。
-
AVE澄清:AI代理弱点分类类似CWE,而非CVE
作者澄清,AVE(Agent Vulnerability Enumeration,代理漏洞枚举)更类似于CWE(Common Weakness Enumeration,通用弱点枚举),而不是CVE(Common Vulnerabilities and Exposures,通用漏洞披露)。与识别特定软件版本中具体缺陷的CVE不同,AVE记录描述的是AI代理弱点的行为类别,例如通过描述操纵进行的工具投毒。这一区别很重要,因为AVE处理的是…
-
开发者寻求对新型LLM漏洞检测基准测试的反馈
一位开发者创建了一个基准测试系统,旨在测试大型语言模型(LLMs)在代码混淆和包含误导性注释的情况下检测代码漏洞的能力。该系统使用Juliet测试用例,并进行了修改以使其看起来像一个真实的代码库,同时还加入了具有不同情感倾向的注释,以检验它们对LLM性能的影响。开发者正在寻求关于该项目新颖性和潜力的反馈,并希望在完成其演示和与已发布的LLMs进行基准测试方面获得帮助。
-
基于系统调用的HIDS泛化到未见过的CVEs结果喜忧参半
研究人员探索了基于系统调用的主机入侵检测系统(HIDS)的泛化能力。他们研究了在特定通用漏洞披露(CVEs)的正常行为上训练的HIDS,这些CVEs共享同一通用弱点枚举(CWE)类别,是否能够检测同一类别中未见过的CVEs。研究发现,虽然CWE级别的泛化对于某些弱点家族是可行的,但并非普遍适用,并且很大程度上受到正常行为配置文件的广度影响,而不仅仅是CWE标签。
-
基于系统调用的 HIDS 泛化在 CVE 和 CWE 中进行测试
研究人员调查了利用系统调用跟踪的主机入侵检测系统 (HIDS) 的泛化能力。该研究实证测试了在共享同一通用弱点枚举 (CWE) 类的已知通用漏洞和暴露 (CVE) 上训练的异常检测器是否能够识别同一类中新的、未见的 CVE。研究结果表明,虽然使用当前的系统调用特征可以实现某些弱点家族的 CWE 级别泛化,但并非普遍有效,并且可能具有方向依赖性。研究还强调了校准误报率对于该领域可靠报告的重要性。
-
开发者将OWASP安全审计集成到Claude Code工作流程中
一位开发者为Claude Code创建了一个自定义命令,以便在部署前对文件进行自动安全审计。该命令提示Claude识别特定的漏洞,如SQL注入、跨站脚本攻击和不安全的直接对象引用,并为每个已识别的问题提供详细的修复建议和通用弱点枚举(CWE)编号。开发者强调了最小化误报的重要性,以确保审计的实际效用,并将此安全审查更早地集成到开发周期中。
-
新SPARK系统增强LLM安全代码生成
研究人员开发了SPARK,一个新颖的推理时系统,旨在提高大型语言模型生成代码的安全性。SPARK通过激活其训练数据中已存在的潜在安全知识来解决LLM生成存在漏洞的代码的问题,而不是依赖于广泛的微调或外部检索。该系统包含两个组件:一个通过结构化提示向模型提供相关安全信息,另一个在生成过程中对模型的输出应用预先计算的偏差。在包括Claude和DeepSeek在内的多种编程语言和模型上的评估表明,SPARK在保持代码可用性的同时,性能与现有…
-
LLM框架自动化漏洞分析报告
研究人员开发了RAVEN框架,该框架利用大型语言模型(LLMs)和检索增强生成(RAG)技术自动生成详细的漏洞分析报告。RAVEN根据易受攻击的源代码生成报告,遵循Google Project Zero的根本原因分析模板。该系统包括用于探索、知识检索、影响评估和报告生成的代理,以及用于质量评估的LLM Judge。对105个代码样本的初步测试显示,平均质量得分为54.21%。
-
尽管提示技术先进,AI 生成代码的安全性仍令人担忧
新研究表明,虽然先进的提示技术可以影响 AI 生成代码中存在的安全漏洞的类型,但它们并不能可靠地减少这些问题的总体数量或严重性。对多种编程语言的多个 LLM 进行的评估研究发现,生成的代码经常包含关键漏洞,例如弱加密和不当的输入验证。虽然一些方法改变了常见漏洞枚举 (CWE) 的分布,但它们并未消除固有风险,这表明仅靠提示工程不足以确保安全的代码生成。
-
CyberSecQwen-4B:小型专业化模型为网络安全提供本地防御
一款名为 CyberSecQwen-4B 的新型专业化语言模型已被开发用于防御性网络安全任务。该模型设计小巧,可本地运行,并在无需外部 API 的情况下处理敏感数据,解决了大型通用前沿模型存在的局限性。它在 CWE 分类和 CVE-to-CWE 映射等任务中表现出色,在需要更少资源的情况下优于一个更大的模型。