reskSecure
PulseAugur coverage of reskSecure — every cluster mentioning reskSecure across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
reskSecure 推出位掩码防火墙以实现 LLM 访问控制
reskSecure Python 包通过实现一个 64 位权限位掩码防火墙,引入了一种新颖的 LLM 安全方法。该系统将代理功能和用户权限编码到位中,直接在模型的生成循环中强制执行,以防止禁止的短语和不安全工具的调用。与基于提示或后生成过滤的方法不同,reskSecure 在令牌级别进行干预,将 logits 设置为负无穷大或应用惩罚,在不允许的操作发生之前进行阻止。该系统利用声明式 YAML 策略文件来定义与特定位掩码相关的规则和…
-
新的 Python 包 reskSecure 可作为 LLM 防火墙阻止越狱
一个名为 reskSecure 的新 Python 包已被开发出来,用作大型语言模型 (LLM) 的防火墙,旨在防止越狱和提示注入。与依赖提示工程或后生成过滤的传统方法不同,reskSecure 直接干预模型的 token 生成循环。它利用一个 64 位权限位掩码来控制 LLM 被允许输出的内容,将 logits 设置为负无穷以进行硬性阻止或对偏差应用惩罚,从而增强安全性。
-
新的reskSecure方法在令牌级别阻止LLM越狱
一种名为reskSecure的新安全方法已被开发出来,用于防止针对LLM代理的提示注入攻击。与依赖提示过滤或后生成审核的传统方法不同,reskSecure在令牌级别于模型的生成循环内运行。它使用位掩码来强制执行权限,在生成不允许的短语和工具调用之前进行阻止或惩罚,从而防止敏感信息泄露。
-
Resk-Security 推出开源大语言模型防火墙以阻止有害 token
Resk-Security 发布了 reskSecure,这是一款新的开源工具,旨在通过在 token 生成前的 logits 层面进行过滤来增强大语言模型(LLM)的安全性。这种预防性方法旨在阻止有害 token 被采样,不同于在生成后过滤输出的传统方法。该工具利用能力位掩码系统,根据用户定义的策略对特定 token 进行惩罚或阻止,提供 HARD(无法生成)和 BIAS(可配置惩罚)等模式。reskSecure 可以集成到 Pyt…
-
新型位掩码防火墙增强 LLM 安全性
reskSecure 项目推出了一种新颖的基于位掩码的防火墙,旨在增强大型语言模型 (LLM) 的安全性。这种方法旨在提供强大的防御机制,以应对 LLM 应用中固有的潜在威胁和漏洞。开发重点是创建一个可以集成到现有 LLM 框架中的实用安全解决方案。
-
ReskSecure 库在 Logits 层面阻止 LLM 越狱
Resk 发布了 reskSecure,这是一个 Python 库,旨在防止生产环境中 LLM 系统的提示注入和越狱攻击。与过滤输出文本的传统方法不同,reskSecure 在 logits 层面运行,在模型采样危险 token 之前拦截并阻止它们。这种方法通过在生成前修改 token 概率,旨在防止敏感数据泄露、未经授权的 API 调用和有害内容的生成。
-
RESK Security 推出 Logit 级别的大语言模型安全工具
RESK Security 开发了两款新工具 resk-logits 和 reskSecure,旨在通过在 token 被采样之前干预 Logit 级别来增强大语言模型的安全性。这些工具旨在通过修改 token 概率来防止有害内容的生成,与传统的输出扫描方法相比,提供了一种主动的方法。这两款工具均可通过 Python Package Index 获取,并在 GitHub 上开源。
-
模型蒸馏攻击构成日益增长的 AI 安全威胁
模型蒸馏攻击,即小型模型从大型模型输出中学习,构成了一种未被充分认识到的 AI 系统安全威胁。这些攻击可以绕过安全对齐,导致模型生成有害内容,尽管其“教师”模型有安全防护措施。此外,蒸馏还可以通过使攻击者能够以更低的成本复制高性能模型来促进知识产权盗窃,并且可以通过发布看似无害但随后被恶意更新的蒸馏模型来污染 AI 供应链。resk-logits 和 reskSecure 等运行时安全工具通过在 logits 层面过滤危险 token…
-
Anthropic的Mythos 5已获授权,Fable 5将回归;OpenAI推出GPT-5.6系列
近期发展,特别是Anthropic的模型和OpenAI的新发布,已显著重塑了AI格局。Anthropic的先进网络安全模型Mythos 5已获得美国政府授权,将向100多家机构发布,尽管此前存在监管担忧。然而,其此前被美国出口管制指令下线的“安全”公开版本Claude Fable 5,预计将很快回归,这凸显了政治对前沿模型可用性日益增长的影响力。与此同时,OpenAI推出了其GPT-5.6系列,包含三个层级:Sol用于旗舰性能,Ter…