研究人员开发了Recast,一个旨在预测大型语言模型(LLM)在多轮交互中安全风险的新框架。与现有对违规行为做出反应的方法不同,Recast通过分析风险在对话轨迹中的演变来预测潜在的安全故障。该系统使用对话历史的双尺度视图和因果时间编码来预测未来风险的出现,在预测安全故障方面取得了88.3%的成功率,平均提前量为2.41轮。 AI
影响 该框架可以为LLM代理启用更主动的安全措施,在故障发生前进行预防。
排序理由 该集群包含一篇详细介绍LLM安全新框架的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- Connected Papers
- DagsHub
- Gotit.pub
- Hugging Face
- IArxiv
- large language models
- Litmaps
- LLMs
- Recast
- ScienceCast
- scite Smart Citations
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →