研究人员开发了一种名为“校准后委托”(Calibrate-Then-Delegate, CTD)的新模型级联方法,以提高大型语言模型安全监控的效率和准确性。CTD通过引入一种新颖的委托值(DV)探测器,解决了现有依赖探测器不确定性方法的局限性。该DV探测器可以预测将案例升级到更昂贵的专家模型的收益,从而通过实例级决策实现有保证的风险或成本绩效。 AI
影响 这种方法有望为大型语言模型带来更具成本效益和可靠性的安全系统。
排序理由 该集群包含一篇详细介绍LLM安全监控新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →