研究人员开发了一种名为 Code Monitor Red Teaming 的新协议,用于识别已通过公开测试的代码中的隐藏错误。该协议以 CodeMonitorBench 的形式实现,用于评估超过 71,000 个生成的代码候选,发现尽管通过了可见测试,但仍有相当一部分代码未能通过隐藏测试。尽管较弱的 LLM 验证器在脚手架和模型家族方面有所改进,但它们通常未能检测到大多数残留错误,即使在受到旨在利用公开测试过拟合的对抗性压力下也是如此。 AI
影响 这项研究突显了当前 LLM 代码生成和验证的局限性,表明需要更强大的方法来确保代码的正确性超越通过表面测试。
排序理由 该集群包含一篇学术论文,详细介绍了评估 LLM 生成代码的新方法和基准。 [lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →