resk-logits
PulseAugur coverage of resk-logits — every cluster mentioning resk-logits across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
RESK Security 发布 TypeScript 和 Python 的开源 LLM 安全工具包
RESK Security 发布了两个开源库:resk-llm-ts 用于 TypeScript,Resk-LLM 用于 Python,旨在保护大型语言模型 (LLM) 应用免受各种安全威胁。这些库充当中介件,位于用户请求和 LLM 端点之间,用于检测和阻止恶意输入,例如提示注入、越狱和个人身份信息 (PII) 泄露。每个库都提供 11 种不同的威胁检测器,包括 PII 扫描、数据泄露防护和毒性过滤器,可以单独启用或禁用。这些工具旨在…
-
新的开源工具可在 logits 层面拦截 LLM 越狱
一款名为 resk-logits 的新开源工具已发布,通过在 token 被采样之前,在 logits 层面拦截有害内容,从而增强 LLM 的安全性。该 GPU 加速处理器使用 Aho-Corasick 算法扫描整个词汇表以查找恶意模式,将匹配 token 的 logits 设置为负无穷以实现硬拦截,或在“影子禁令”模式下应用惩罚。它使用 CUDA 和 Metal 后端开发,开销低于毫秒,并兼容任何 Hugging Face Auto…
-
新的开源工具在 Logits 层过滤 LLM 越狱
Resk-Security 发布了 resk-logits,一个开源的 Python 库,旨在通过在 Logits 层进行过滤来防止大型语言模型 (LLM) 越狱。这种方法在有害 token 生成之前进行拦截,不同于传统的在生成后扫描输出的方法。该库利用 GPU 加速的 Aho-Corasick 算法,在一毫秒内扫描超过 10,000 个不允许的模式,为 LLM 安全提供了更强大、更快速的方法。
-
新工具resk-logits提供主动式Logit级LLM安全防护
一款名为resk-logits的新开源工具通过在Logit层面进行干预,在token被采样之前,提供了一种主动式LLM安全防护方法。与对生成文本做出反应的传统审计和护栏不同,resk-logits会拦截模型的概率分布,以阻止有害的token序列。这种方法使用GPU加速的Aho-Corasick模式匹配来实现,延迟极低,并能更有效地防御越狱和数据污染。
-
RESK Security 推出 Logit 级别的大语言模型安全工具
RESK Security 开发了两款新工具 resk-logits 和 reskSecure,旨在通过在 token 被采样之前干预 Logit 级别来增强大语言模型的安全性。这些工具旨在通过修改 token 概率来防止有害内容的生成,与传统的输出扫描方法相比,提供了一种主动的方法。这两款工具均可通过 Python Package Index 获取,并在 GitHub 上开源。
-
模型蒸馏攻击构成日益增长的 AI 安全威胁
模型蒸馏攻击,即小型模型从大型模型输出中学习,构成了一种未被充分认识到的 AI 系统安全威胁。这些攻击可以绕过安全对齐,导致模型生成有害内容,尽管其“教师”模型有安全防护措施。此外,蒸馏还可以通过使攻击者能够以更低的成本复制高性能模型来促进知识产权盗窃,并且可以通过发布看似无害但随后被恶意更新的蒸馏模型来污染 AI 供应链。resk-logits 和 reskSecure 等运行时安全工具通过在 logits 层面过滤危险 token…
-
新的开源工具以 GPU 速度阻止 LLM 越狱
一款名为 resk-logits 的新开源工具已被开发出来,通过在 token 生成过程中拦截和抑制 logit 级别的有害输出,来增强 LLM 的安全性。这个 GPU 加速的 Aho-Corasick 引擎可以在一毫秒内处理超过 10,000 个模式,从而避免了传统后生成过滤器相关的 token 浪费和延迟峰值。该工具通过对将完成被禁止短语的 token 进行“影子封禁”来运行,为对抗越狱技术提供了一种更有效的方法。
-
Anthropic的Mythos 5已获授权,Fable 5将回归;OpenAI推出GPT-5.6系列
近期发展,特别是Anthropic的模型和OpenAI的新发布,已显著重塑了AI格局。Anthropic的先进网络安全模型Mythos 5已获得美国政府授权,将向100多家机构发布,尽管此前存在监管担忧。然而,其此前被美国出口管制指令下线的“安全”公开版本Claude Fable 5,预计将很快回归,这凸显了政治对前沿模型可用性日益增长的影响力。与此同时,OpenAI推出了其GPT-5.6系列,包含三个层级:Sol用于旗舰性能,Ter…