研究人员开发了新的方法来监控大型语言模型(LLMs),以检测滥用并区分AI生成的文本。一种方法,激活水印(AWM),使用有限的微调来使LLM隐藏状态与密钥对齐,使其更能抵抗自适应攻击者,同时保持检测率。AWM还允许归因于特定的策略违规。另一种方法侧重于使用Rao-Blackwellized e-processes进行高效的在线水印检测,从而实现流式生成中的随时有效推理和严格的I类错误控制。 AI
影响 这些进展可能导致更可靠的AI生成内容检测和更好的LLM滥用预防。
排序理由 两篇arXiv论文介绍了关于LLM监控和水印技术的新研究。
- arXiv
- Gumbel-max watermark
- large language models
- Rao-Blackwellized e-processes
- Activation Watermarking
- LLM
- Toluwani Aremu
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →