实体
Toluwani Aremu
Toluwani Aremu
PulseAugur coverage of Toluwani Aremu — every cluster mentioning Toluwani Aremu across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
新防御方法在不损失效用的情况下减轻AI水印伪造
一篇新研究论文提出了一种减轻生成式AI模型中水印伪造的方法。所提出的防御措施包括为每次查询随机选择水印密钥,并且仅当水印被一个且仅一个密钥检测到时才接受内容。这种方法旨在为盲水印攻击者提供一个与样本数量无关的伪造成功率上限,同时不损害模型效用。该方法与模态无关,可应用于现有的水印技术,实证研究表明,在文本和图像水印的伪造成功率方面均有显著降低。
-
新方法增强LLM监控和AI文本检测
研究人员开发了新的方法来监控大型语言模型(LLMs),以检测滥用并区分AI生成的文本。一种方法,激活水印(AWM),使用有限的微调来使LLM隐藏状态与密钥对齐,使其更能抵抗自适应攻击者,同时保持检测率。AWM还允许归因于特定的策略违规。另一种方法侧重于使用Rao-Blackwellized e-processes进行高效的在线水印检测,从而实现流式生成中的随时有效推理和严格的I类错误控制。