实体
Juliet
Juliet
PulseAugur coverage of Juliet — every cluster mentioning Juliet across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
研究发现:大型语言模型难以检测现实世界中的代码漏洞
一篇新近发表在arXiv上的研究评估了深度学习模型和大型语言模型在代码漏洞检测方面的实际有效性。研究发现,包括Claude 3.5 Sonnet、GPT-4o和GPT-5等知名大型语言模型在内的当前模型,在从基准数据集泛化到现实世界场景时存在困难。当在最近修复的Linux内核漏洞的新构建数据集上进行测试时,模型的性能显著下降,凸显了学术评估与实际应用之间的差距。
-
开发者寻求对新型LLM漏洞检测基准测试的反馈
一位开发者创建了一个基准测试系统,旨在测试大型语言模型(LLMs)在代码混淆和包含误导性注释的情况下检测代码漏洞的能力。该系统使用Juliet测试用例,并进行了修改以使其看起来像一个真实的代码库,同时还加入了具有不同情感倾向的注释,以检验它们对LLM性能的影响。开发者正在寻求关于该项目新颖性和潜力的反馈,并希望在完成其演示和与已发布的LLMs进行基准测试方面获得帮助。