研究人员开发了一种评估AI系统内容审核的新方法,侧重于端到端权衡而非孤立的分类器准确性。该研究引入了两个关键指标:有用性(Usefulness),衡量包含相关且无害响应的回合的比例;以及有害暴露(Harmful Exposure),跟踪包含有害响应的回合的比例。实验比较了不同的审核策略,包括仅输入、仅响应以及组合输入-响应阻止,发现仅响应阻止实现了高有用性,而输入-响应阻止则降低了有害暴露。研究还探讨了响应重写作为在保持安全水平的同时恢复被阻止流量的技术,表明审核配置应基于部署特定的安全和延迟限制进行评估。 AI
影响 这项研究为评估AI内容审核系统提供了一个新框架,有望带来更安全、更有用的AI交互。
排序理由 这是一篇详细介绍AI内容审核评估新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →