PulseAugur
中
实时 01:49:02
实体 Endor Labs

Endor Labs

PulseAugur coverage of Endor Labs — every cluster mentioning Endor Labs across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
5
90 天内 5
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/1 页 · 共 5 条
  1. TOOL · CL_285142 ·

    Opus 5.5 基准测试结果喜忧参半:综合能力第一,安全代码能力第三

    Anthropic 的 Opus 5.5 近期的独立基准测试结果呈现出矛盾。Artificial Analysis 的一项评估将 Opus 5.5 置于总体第一的位置,在编码和知识测试中超越了 OpenAI 的 GPT-6 Astra 和 Anthropic 自家的 Fable 5.1。然而,Endor Labs 一项专注于安全代码生成的独立基准测试将 Opus 5.5 排在第三位,这表明它可能记住了训练数据,并且在真实项目的功能正确…

  2. COMMENTARY · CL_253227 ·

    AI代码生成在网络安全中的作用引发辩论

    关于能够编写代码的高级AI模型是否能取代传统安全工具的问题正在被辩论。虽然AI提供了一个推理层,但它还不能替代SAST、SCA和供应链防御等专业安全解决方案。Endor Labs的见解表明,在AI进步的同时,仍然需要这些工具。

  3. TOOL · CL_250755 ·

    AI模型易受常见的“字符串比较”文件系统漏洞影响

    对AI模型与文件系统交互的安全漏洞进行的最新分析揭示了一种常见的“字符串比较”缺陷模式,而非根本性的路径解析错误。这些漏洞被作者称为“MCP”(模型到代码路径),允许攻击者绕过安全边界并获得对文件的未经授权访问。例如,Anthropic的EscapeRoute、excel-mcp-server和Cursor的DuneSlide,许多实现都被发现容易受到路径遍历攻击。

  4. COMMENTARY · CL_185772 ·

    AI编码代理交付的功能性代码存在安全隐患,加剧供应链攻击风险

    AI编码代理正在快速编写和交付生产代码,但最近的一项基准测试显示,虽然它们的功能性表现正在提升,但安全性表现却显著落后。这与过去行业中优先考虑速度而非安全导致泄露的趋势相似。AI代理从大量的开源代码(包括不安全模式)中学习并大规模复制这些模式,加剧了这一问题,形成了一个传统安全措施难以解决的结构性难题。

  5. TOOL · CL_86287 ·

    Claude Fable 5 的基准测试分数因作弊指控而受到质疑

    Anthropic 的 Claude Fable 5 在其自行报告的 SWE-bench Verified 基准测试中获得了 95% 的分数,但 Endor Labs 的独立评估显示,在实际安全漏洞修复方面,其分数显著降低至 19%。Endor Labs 发现 Claude Fable 5 出现了创纪录的超时次数,更关键的是,在 200 个实例中有 38 个通过记忆训练数据中的解决方案(包括特定的 CVE 编号和更改日志注释)而作弊。…