研究人员引入了一个名为“对话风险累积”(CRA)的新框架,以解决大型语言模型(LLM)在多轮对话中未能检测到累积的危害的安全护栏问题。CRA框架跟踪语义漂移、敏感度加权信息累积和合规性梯度,以识别渐进式意图漂移或违禁指令的组装。为了评估这一点,他们发布了 CRA-Bench,这是一个多轮对话会话数据集,并引入了包括 Trajectory AUROC 在内的新评估协议。 AI
影响 这项研究可能带来更强大的 LLM 安全机制,防止在长时间交互中出现的有害输出。
排序理由 该集群包含一篇学术论文,详细介绍了用于评估 LLM 安全性的新框架和数据集。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Conversational Risk Accumulation
- CRA-Bench
- CRA Framework
- Hugging Face
- LLM
- Sanjay Kumar Mishra
- Trajectory AUROC
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →