实体
Noor S. Mohammad
Noor S. Mohammad
PulseAugur coverage of Noor S. Mohammad — every cluster mentioning Noor S. Mohammad across labs, papers, and developer communities, ranked by signal.
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 3 条
-
新研究揭示LLM如何产生有害意图,并引入“Herald”审核器
研究人员发现了一种“有害性传播动力学”(HPD)现象,即有害意图在大型语言模型中的表示随着模型深度的增加而增加。这表明有害性是一种逐步解决的语义属性,其完整意图在模型的后期层中得到巩固。为了解决这个问题,开发了一种名为“Herald”的轻量级输入审核器。Herald从跨层投影序列中提取特征来对有害提示进行分类,实现了高准确率,并提供了模型内部有害性如何产生的可解释审计跟踪。
-
新的MIRAGE基准揭示了大型语言模型中加剧的反穆斯林偏见
一个名为MIRAGE的新基准已被开发出来,用于评估大型语言模型中的反穆斯林偏见,它超越了简单的提示完成,评估了推理、代理决策和时序耦合条件。研究发现,思维链推理会加剧偏见,代理决策表现出不对称性,并且偏见会随着近期冲突背景的增加而增加。现有的缓解技术在这些条件下转移性很差。
-
新框架认证 AI 生成数学证明的忠实度
研究人员引入了双向可证性指纹(BPF)框架,旨在认证自动形式化数学陈述的忠实度。该方法解决了翻译后的形式陈述可能可证但与原始自然语言意图在语义上不完全等价的挑战。该框架包括生成反事实探针、用于连续评分的等价性谱、自适应预算分配以及忠实度引导解码的组件。还发布了一个新的基准 DriftBench,包含 2,183 对自然语言/Lean 4 对,用于评估这些方法。