Qwen-2.5-Coder-7B
PulseAugur coverage of Qwen-2.5-Coder-7B — every cluster mentioning Qwen-2.5-Coder-7B across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
本地7B大语言模型未能通过安全测试,表现不如简单的正则表达式
一位AI安全研究员发现,本地运行的70亿参数模型Qwen-2.5-Coder-7B,错误地将“如何杀死一个Python进程?”这类良性句子标记为暴力犯罪。尽管该模型在被直接询问时表现出对“一群乌鸦”(murder of crows)这类同音异义词的了解。研究员发现,一个带有异常列表的简单手写正则表达式,在准确分类这些句子方面优于大语言模型,这表明AI安全评分可能在很大程度上受到周围测试框架的影响,而非仅仅是模型固有的能力。该实验是在低…
-
发布用于 LLM 的 Java 和 Rust 漏洞检测新基准
发布了两个新的基准测试集 JavaVulBench 和 RustMizan,用于评估大型语言模型在软件漏洞检测方面的能力。JavaVulBench 专注于 Java 方法,包含超过 1,740 个通用漏洞披露 (CVE),并提供多种真实的拆分策略用于测试。RustMizan 针对 Rust 漏洞,提供可编译的代码和一个突变框架来测试污染和鲁棒性。与之前使用小型代码片段且缺乏污染意识的数据集相比,这两个基准测试旨在提供更现实、更全面的评估。
-
新方法ActHook为大语言模型代理轨迹添加水印以保护版权
研究人员开发了ActHook,一种新颖的水印技术,旨在保护大语言模型(LLM)代理轨迹数据集的版权。该方法将隐藏的“钩子动作”嵌入数据中,通过密钥激活,可以在不影响代理性能的情况下检测未经授权的使用。实验表明,ActHook在识别带水印的轨迹方面非常有效,并且在用于编码和网络搜索的代理等各种代理类型上均能达到高准确率。