PulseAugur
实时 19:02:17
实体 ExploitBench

ExploitBench

PulseAugur coverage of ExploitBench — every cluster mentioning ExploitBench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 9
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
关系
时间线
  1. 2026-06-18 research_milestone Carnegie Mellon University researchers developed ExploitBench to measure AI model exploit capabilities. 来源
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 9 条
  1. RESEARCH · CL_207346 ·

    AI 模型发现 Bug 并绕过安全过滤器,加剧安全事件

    一款新的代码模型 GLM 5.3 在发布一天内就发现了 AI 代码编辑器 Cursor 的一个实时漏洞。这凸显了一个日益增长的担忧,即能够识别安全漏洞的 AI 模型也可能被用来利用这些漏洞。与此同时,一种名为 GhostSplice 的技术展示了攻击者如何将恶意指令分散到不同的通信渠道,从而绕过可能检测到单个完整请求的 AI 安全过滤器。这些进展正在导致 DevOps 环境中与 AI 相关的安全事件显著增加。

  2. TOOL · CL_206946 ·

    智谱AI的GLM-5.3在网络安全基准测试中表现不一

    智谱AI发布了其GLM-5.3模型,该模型在网络安全基准测试中 purported 的卓越表现引起了广泛关注。虽然该模型在CyberGym基准测试中发现软件漏洞方面确实比Anthropic的Mythos 5和OpenAI的GPT-5.6 Sol取得了稍高的分数,但智谱自己的发布说明表明其在不同网络安全任务中的表现更为复杂。在需要对可利用性和任务完成度进行更深层次推理的基准测试中,GLM-5.3的性能明显落后于其美国竞争对手,这一点在初…

  3. FRONTIER RELEASE · CL_200360 ·

    Z.ai 的 GLM-5.3 通过训练后实现编码和网络安全领域的 SOTA

    Z.ai 发布了 GLM-5.3,这是一个更新的模型,通过扩展训练后而非更改其基础模型实现了显著的性能提升。该模型在复杂的编码任务中表现出明显的改进,尤其是在 Terminal-Bench 3.0 等长周期基准测试中,并在网络安全领域展现出新兴能力,在 CyberGym 基准测试中名列前茅。虽然 GLM-5.3 可通过 API 和特定计划获得,但 Z.ai 计划在完成安全评估后约两周内发布模型权重。

  4. RESEARCH · CL_161580 ·

    英国/美国评估 Kimi K3 网络能力,发现其落后于前沿模型

    英国人工智能安全研究所 (UK AISI) 和美国人工智能标准与创新中心 (CAISI) 的一项初步评估,对 Moonshot AI 的 Kimi K3 模型进行了网络安全能力评估。评估发现,在漏洞开发和模拟网络攻击方面,Kimi K3 的表现明显落后于领先的美国前沿模型,在 32 步攻击路径中达到的步数更少。然而,在这些初步网络评估中,Kimi K3 的表现优于 GLM-5.2 模型。值得注意的是,该模型的安全防护措施并未阻止其协助…

  5. RESEARCH · CL_161358 ·

    Kimi K3 在网络漏洞测试中落后于美国模型,蒸馏被怀疑 · 跟踪到 2 个来源

    Moonshot AI 的 Kimi K3 模型在网络漏洞任务上的表现明显弱于领先的美国模型,在 ExploitBench 上的得分仅为 32%,而美国模型为 76%。该模型的安全防护措施在阻止模拟攻击方面也显得不足。研究人员推测,Kimi K3 在通用基准测试中得分较高,但在安全相关评估中表现不佳的差异,可能归因于蒸馏技术,其中可能涉及 Anthropic 的模型。

  6. TOOL · CL_161121 ·

    研究发现中国Kimi K3在网络安全能力方面落后于美国竞争对手

    一项英国和美国政府联合研究发现,中国的Kimi K3大型语言模型在网络安全能力方面显著逊色于领先的美国模型。该研究使用ExploitBench基准进行,结果显示Kimi K3的总体得分为32.2%,而美国顶级模型的平均得分为76.2%。Kimi K3未能实现任意代码执行,这是美国顶级模型在多项任务中都展示出的关键漏洞利用能力。

  7. TOOL · CL_118742 ·

    苹果加强安全措施以应对供应商泄密和人工智能黑客攻击担忧

    苹果公司正在加强其网络安全措施,以应对其供应商 Tata 遭受的重大供应链攻击,该攻击导致客户文件泄露以及关于未发布 iPhone 型号的信息泄露。该公司还将改变其安全补丁发布策略,转向在完整操作系统更新之前部署修复程序,以缩短漏洞暴露时间,这一改变归因于人工智能驱动威胁的加速。此次攻击被归因于勒索软件组织 World Leaks,也影响了 TSMC 和 Qualcomm 等其他苹果合作伙伴,暴露了敏感的组件细节。人们还对 Anthr…

  8. TOOL · CL_99011 ·

    AI模型被测试利用漏洞能力;Anthropic的Mythos展示了高级执行能力

    卡内基梅隆大学的研究人员开发了ExploitBench,这是一个新的框架,用于衡量AI模型利用安全漏洞的有效性。虽然大多数公开的前沿模型会导致崩溃,但它们通常无法突破沙箱环境。然而,Anthropic的私有Mythos Preview模型在41个漏洞中的18个上展示了完整的代码执行能力,这表明AI在网络安全利用方面的能力令人担忧地进步了。

  9. SIGNIFICANT · CL_35147 ·

    Anthropic强大的Claude Mythos AI通过承包商访问被泄露

    据报道,Anthropic能力极强的网络安全AI模型Claude Mythos在其有限预览开始后不久被未经授权的用户访问。此次泄露是通过承包商的内部知识和另一次数据泄露的信息相结合而发生的,而非复杂的黑客攻击。尽管Anthropic高度重视AI安全,但此次事件引发了对供应链安全以及Anthropic管理其最强大、潜在危险的AI系统访问能力问题的担忧。