Alexandre Maiorano PhD
PulseAugur coverage of Alexandre Maiorano PhD — every cluster mentioning Alexandre Maiorano PhD across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新的大语言模型用户体验微模拟协议通过公开数据验证
研究人员开发了一种新的协议,用于创建由大语言模型驱动的用户体验微模拟,旨在提供早期决策支持,而无需进行广泛的用户研究。这种产出优先的流程从版本化的提示和用户画像中生成结构化反馈,包括摩擦点和调查信号。使用应用商店评论和支持推文等公开语料库对模拟进行验证,并使用 Jaccard 和加权 Jaccard 等对齐指标来比较不同的代理策略和嵌入基线。
-
在对抗性攻击下,LLM对齐的有效性因指标而异
一篇新的研究论文探讨了LLM对齐与正则表达式过滤器结合使用的有效性,特别是在对抗性条件下。研究发现,虽然单独使用正则表达式过滤器对常见的OWASP LLM Top-10类别非常有效,但LLM判断器可以检测到对抗性构建的探测中细微的拒绝,而简单的子字符串分类器会错过这些。这表明LLM对齐的贡献取决于评估指标,在采用复杂的检测方法时具有显著价值。
-
研究人员从攻击模拟中自动生成安全规则
研究人员开发了一种从攻击模拟中自动生成安全检测规则的方法。该系统将入侵与攻击模拟 (BAS) 工具的发现确定性地映射到 Sigma 初始规则,Sigma 规则是安全信息和事件管理 (SIEM) 系统中使用的供应商中立格式。该方法确保了从模拟攻击到可部署规则的可验证和可重现路径,提供了可追溯到原始探针和 MITRE ATT&CK 技术的精确可追溯性。
-
新研究表明,大型语言模型防御在应对释义攻击方面的有效性各不相同
一篇新的研究论文探讨了不同的防御机制对常见大型语言模型漏洞的有效性。研究发现,虽然拒绝短语过滤器对越狱和系统提示泄露有效,但它们很脆弱,并且可以通过释义攻击来规避。另一方面,预算控制在应对释义攻击方面更具弹性,并能有效缓解敏感信息泄露和无界消耗威胁。
-
研究发现 AI 助教防御以牺牲可用性为代价
一篇新的研究论文评估了 AI 助教的提示注入防御的有效性,强调了安全、可用性和响应速度之间固有的权衡。该研究引入了一种方法和基准来比较不同的防御机制,发现多层安全管道可以实现低绕过率和低误报率。该研究旨在帮助教育类 AI 系统根据特定机构的风险和可用性要求来选择防护措施。