OpenAI Moderation
PulseAugur coverage of OpenAI Moderation — every cluster mentioning OpenAI Moderation across labs, papers, and developer communities, ranked by signal.
-
新的 btp-guard 工具通过零延迟 AST 评估增强了本地 LLM 代理的安全性
一个名为 btp-guard 的新工具已被开发出来,通过防止恶意代码执行来增强本地 LLM 代理的安全性。该工具通过在 Python、SQL 和 Bash 代码执行之前实时评估其抽象语法树 (AST) 来运行。通过检测和阻止危险命令,如文件删除、数据库清除或凭证泄露,btp-guard 旨在不依赖外部云服务即可维护本地 LLM 操作的隐私和安全。
-
大型语言模型在有害内容审核方面展现出潜力,但挑战依然存在
研究人员正在探索使用大型语言模型(LLMs)来提高社交媒体平台内容审核的有效性和可扩展性。一项研究表明,少样本LLM方法在识别有害内容方面优于现有的专有基线和最先进的方法,即使在整合视觉信息时也是如此。另一项对11个数据集的53个模型的综合评估显示,虽然前沿模型在某些领域表现出色,但小型专业模型在其他领域更胜一筹,而现实世界中的对话安全仍然是一个重大挑战。另一项针对德国社交媒体的独立研究成功地使用LLM投票者集成,在检测各种有害内容方…
-
新的 D^2-Monitor 系统增强了扩散式大语言模型的安全性
研究人员推出了一种新颖的 D-LLMs 安全监控系统 $D^2$-Monitor。该系统解决了扩散式大语言模型(D-LLMs)监控的独特挑战,D-LLMs 通过多步过程生成文本,暴露了中间表示。$D^2$-Monitor 将“安全犹豫”——即中间状态反复接近探测器的决策边界——识别为潜在探测器失败的关键指标。它采用动态路由机制,仅当犹豫水平超过阈值时才激活资源密集型探测器,从而优化效率。
-
Sentra-Guard 系统针对对抗性 LLM 提示实现了 99.96% 的检测率
研究人员开发了 Sentra-Guard,一个旨在防御针对大型语言模型(LLM)的对抗性提示的实时系统。该系统采用混合方法,结合语义嵌入和 Transformer 分类器来识别和中和越狱和提示注入攻击。Sentra-Guard 通过翻译非英语提示进行评估,展现了多语言弹性,并包含一个人工反馈机制以实现持续学习。