PulseAugur
实时 08:36:05

新的红队测试协议揭示了 LLM 生成代码中隐藏的错误

研究人员开发了一种名为 Code Monitor Red Teaming 的新协议,用于识别已通过公开测试的代码中的隐藏错误。该协议以 CodeMonitorBench 的形式实现,用于评估超过 71,000 个生成的代码候选,发现尽管通过了可见测试,但仍有相当一部分代码未能通过隐藏测试。尽管较弱的 LLM 验证器在脚手架和模型家族方面有所改进,但它们通常未能检测到大多数残留错误,即使在受到旨在利用公开测试过拟合的对抗性压力下也是如此。 AI

影响 这项研究突显了当前 LLM 代码生成和验证的局限性,表明需要更强大的方法来确保代码的正确性超越通过表面测试。

排序理由 该集群包含一篇学术论文,详细介绍了评估 LLM 生成代码的新方法和基准。 [lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的红队测试协议揭示了 LLM 生成代码中隐藏的错误

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Junchi Liao, Jiawen Deng, Fuji Ren ·

    Code Monitor 公开测试代码的红队演练

    arXiv:2607.20852v1 Announce Type: new Abstract: Visible tests are a common gate for LLM-generated code, but passing them does not certify specification correctness. We study a deployment-like monitoring problem: after code has passed public tests, can a weaker LLM verifier identi…