Researchers have developed WeSCE, a new benchmark designed to measure security drift in code edited by large language models (LLMs). This benchmark includes 400 executable programs derived from real-world code, covering various editing tasks like bug fixing and refactoring. WeSCE proposes a continuous risk representation to aggregate vulnerability signals and measures changes in overall risk, worst-case severity, and vulnerability distribution. AI
IMPACT This benchmark will help researchers and developers better understand and mitigate security risks introduced by LLMs in code generation and editing.
RANK_REASON The cluster contains a research paper detailing a new benchmark for LLM-driven code editing. [lever_c_demoted from research: ic=1 ai=1.0]
AI-generated summary · Google Gemini · from 1 sources. How we write summaries →