PulseAugur
实时 07:21:19
English(EN) Choosing Where and How to Moderate: End-to-End Trade-offs in Filter Placement and Response Rewriting

新的AI审核方法平衡了有用性和安全性

研究人员开发了一种评估AI系统内容审核的新方法,侧重于端到端权衡而非孤立的分类器准确性。该研究引入了两个关键指标:有用性(Usefulness),衡量包含相关且无害响应的回合的比例;以及有害暴露(Harmful Exposure),跟踪包含有害响应的回合的比例。实验比较了不同的审核策略,包括仅输入、仅响应以及组合输入-响应阻止,发现仅响应阻止实现了高有用性,而输入-响应阻止则降低了有害暴露。研究还探讨了响应重写作为在保持安全水平的同时恢复被阻止流量的技术,表明审核配置应基于部署特定的安全和延迟限制进行评估。 AI

影响 这项研究为评估AI内容审核系统提供了一个新框架,有望带来更安全、更有用的AI交互。

排序理由 这是一篇详细介绍AI内容审核评估新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的AI审核方法平衡了有用性和安全性

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Mengya Hu, Susie Park, Suzana Ilic, Qiong Wei, Sandeep Atluri, Myra Deng, Tucker Fross, Curt Tigges ·

    选择何处以及如何进行审核:过滤位置和响应重写的端到端权衡

    arXiv:2607.26200v1 Announce Type: new Abstract: Content-moderation classifiers are usually evaluated in isolation, but deployment requires choosing where to intervene and what follows a flag. We evaluate these choices using two end-to-end customer-outcome metrics rather than comp…