实体
OWASP Benchmark
OWASP Benchmark
PulseAugur coverage of OWASP Benchmark — every cluster mentioning OWASP Benchmark across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
Gemma 和 GPT-4o mini 的行为在新 AI 实验中得到分析
一项评估语言模型对提示锚定敏感性的实验揭示了它们行为的显著差异。Gemma 表现出强大的无视错误警报的能力,而 GPT-4o mini 则倾向于确认高比例的标记代码,使得区分谄媚和过度报告变得困难。为了解决这些歧义,设计了一个改进的实验方案,包括对预测和结果进行预注册,以确保客观分析。
-
AI 漏洞扫描器在首次 OWASP Benchmark 测试中召回率达到 7%
一款 AI 漏洞扫描器,旨在结合确定性静态分析规则和 LLM 进行误报判断,在首次 OWASP Benchmark 测试中仅达到 7% 的召回率。这一低召回率表明扫描器错过了 93% 的目标漏洞,而其 60% 的精确率则表明当它发出警报时,通常是正确的。开发者认为这一低召回率是一个有价值的诊断,表明需要扩展扫描器的漏洞模式词汇量,而不是其核心机制存在根本性缺陷。