PulseAugur
实时 08:15:21
English(EN) Calibrate-Then-Delegate: Safety Monitoring with Risk and Budget Guarantees via Model Cascades

新的CTD模型级联提高了LLM安全监控效率

研究人员开发了一种名为“校准后委托”(Calibrate-Then-Delegate, CTD)的新模型级联方法,以提高大型语言模型安全监控的效率和准确性。CTD通过引入一种新颖的委托值(DV)探测器,解决了现有依赖探测器不确定性方法的局限性。该DV探测器可以预测将案例升级到更昂贵的专家模型的收益,从而通过实例级决策实现有保证的风险或成本绩效。 AI

影响 这种方法有望为大型语言模型带来更具成本效益和可靠性的安全系统。

排序理由 该集群包含一篇详细介绍LLM安全监控新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的CTD模型级联提高了LLM安全监控效率

报道来源 [1]

  1. arXiv cs.LG TIER_1 English(EN) · Edoardo Pona, Milad Kazemi, Mehran Hosseini, Yali Du, David Watson, Osvaldo Simeone, Nicola Paoletti ·

    校准后委托:通过模型级联实现风险和预算保障的安全监控

    arXiv:2604.14251v2 Announce Type: replace Abstract: Monitoring LLM safety at scale requires balancing cost and accuracy: a cheap latent-space probe can screen every input, but hard cases should be escalated to a more expensive expert. Existing cascades delegate based on probe unc…