实体
LLM Monitors
LLM Monitors
PulseAugur coverage of LLM Monitors — every cluster mentioning LLM Monitors across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
新论文识别出大型语言模型安全监控中的“监督空白”
一篇题为《监督空白》的新研究论文引入了一个评估大型语言模型(LLM)安全监控器的新颖框架。该论文认为,依赖单一执行轨迹的标准监控器从根本上无法认证诸如跨租户不干扰等关键属性。研究人员提出用定量测量取代二元评估,将“监督空白”定义为监控器性能与最优边界之间的差距。研究发现,虽然一些监控器在零总变差(TV)时表现良好,但随着TV的增长,其有效性会显著下降,在某些情况下,简单的成员资格检查的性能优于它们。论文总结认为,信息和程序对于有效的监…
-
跨领域训练提升 LLM 监控器泛化能力
研究人员探讨了跨领域泛化在训练语言模型监控器方面的有效性。他们的发现表明,在具有不同提示的多个分类任务上进行训练可以部分提高在新、未见领域上的性能。然而,他们也发现了模型在熟悉数据领域内即使面对全新提示也会遇到困难的失败案例。该研究还表明,将分类训练与通用指令遵循相结合可以缓解这些泛化问题,并可能使其他分类器和监控系统受益。